Riassunto:
Dopo aver continuamente rafforzato il ragionamento, il codice e le capacità dell'agente, DeepSeek ha finalmente aggiunto l'input visivo alla V4. La mattina del 31 agosto DeepSeek era in Abbraccio Face ha aperto i pesi del modello DeepSeek-V4-Flash-Vision-Exp e gli sviluppatori possono scaricare direttamente i pesi del modello e distribuirli da soli. Oltre ai file del modello, il magazzino ufficiale include anche implementazioni di inferenza di riferimento di componenti come codificatore visivo e Aligner e copre DFlash Attenzione, MoE, Hyper-Connections e DSpark e altre parti.

Solo 10 giorni fa, DeepSeek ha annunciato ufficialmente il modello V4-Flash-Vision-Exp, con una scala di circa 305 miliardi di parametri. Dalla parola "Exp" nel nome è facile capire che si tratta del primo modello multimodale sperimentale della serie V4. È costruito sull'architettura V4-Flash. Aggiungendo un modulo visivo e continuando la formazione, il modello acquisisce la capacità di elaborare le immagini.
In termini di attività di testo semplice, il funzionario ha affermato che V4-Flash-Vision-Exp e V4-Flash sono generalmente a un livello simile. La differenza principale è che il nuovo modello può riconoscere il contenuto delle foto, leggere il testo negli screenshot, analizzare i grafici e può anche utilizzare le immagini come parte del flusso di lavoro dell'agente, invece di fare affidamento esclusivamente sulle descrizioni testuali.
I casi dimostrati da DeepSeek includono la creazione di PPT in base ai requisiti, la lettura e la modifica di pagine Web e la generazione di pagine front-end con effetti dinamici.

Ciò che queste attività hanno in comune non è il riconoscimento delle immagini nel senso tradizionale, ma il fatto che il modello deve prima comprendere il contenuto visivo e poi combinare codice, ragionamento e chiamate agli strumenti per completare le operazioni successive. A giudicare dal test benchmark pubblicato da DeepSeek, dopo aver aggiunto funzionalità visive, V4 è già vicino al modello di grandi dimensioni multimodale Anthropic Claude Opus 4.8 che ha scelto per il confronto in alcune attività dell'agente multimodale.
Nello specifico, nel test ApexBench, il punteggio Pass@1 di V4-Flash-Vision-Exp è stato di 36,5, inferiore al 39,4 di Opus-4.8. La cartografia è rispettivamente 64,3 e 65,0, il divario è piccolo. Nell'ultimo esame degli agenti, DeepSeek ha ottenuto 27,3, superiore al 25,7 di Opus-4.8. Il punteggio Pass@5 di ZeroBench è 35,0, che è anche superiore al 34,0 di Opus-4.8.

Tra i quattro dati di test multimodali, due hanno superato Opus-4.8
Vale la pena notare che il modulo visivo appena aggiunto non sacrifica in modo significativo le funzionalità originali dell'agente di testo di V4-Flash.
Ad esempio, in Terminal Bench 2.1, la versione Vision ha ottenuto un punteggio di 83,9, mentre V4-Flash-0731 in precedenza aveva ottenuto un punteggio di 82,7; DeepSWE è passato da 54,4 a 59,3, superando il punteggio Opus-4.8 ufficialmente elencato di 58,0. Tuttavia, NL2Repo è solo 57,7, che è significativamente inferiore al 69,7 di Opus-4.8, e CyberGym è sceso dal precedente 76,7 a 75,3. Pertanto, DeepSeek riassume le sue capacità di testo normale come "alla pari" con V4-Flash.
D'altra parte, l'abilità visiva stessa ha dei limiti. Non è un sistema visivo in grado di leggere all’infinito dettagli ad alta definizione.
Secondo la documentazione dell'API DeepSeek, il modello supporta immagini JPEG, PNG, GIF e WebP e può ricevere immagini singole o multiple. Tuttavia, l'immagine verrà ridimensionata in base alle dimensioni prima di entrare nel modello. Le immagini più grandi verranno eventualmente compresse fino a un volume totale di pixel equivalente a circa 800×800 e ciascuna immagine occuperà fino a 384 token.
Il motivo per cui si sceglie questo approccio è controllare il costo computazionale causato dall'input visivo. Tuttavia, il ridimensionamento delle immagini può anche rappresentare una limitazione per le attività che si basano specificamente su testo di piccole dimensioni, trame locali o risoluzione nativa.
Ma nonostante tutto, DeepSeek ha finalmente compensato gli occhi di V4.
Commenti