Riassunto:
Il team Qwen di Alibaba ha recentemente rilasciato una nuova generazione del modello full-modale nativo Qwen3.8-Omni-Flash, che combina ulteriormente la comprensione di audio e video con le funzionalità dell'agente AI.
Il modello supporta quattro moduli di input: testo, immagine, audio e video e fornisce una finestra di contesto di 1 milione di token. Rispetto alla generazione precedente Qwen3.5-Omni-Plus, i funzionari di Qwen affermano che il suo punteggio medio in 29 test benchmark è aumentato di oltre il 25%, riducendo significativamente i costi di elaborazione audio e audio e video.

Uno dei maggiori cambiamenti in Qwen3.8-Omni-Flash è che non si limita a unire insieme il riconoscimento vocale, il riconoscimento delle immagini e altre funzionalità, ma elabora invece in modo nativo diversi tipi di informazioni dal livello del modello. Alibaba spera di utilizzarlo per consentire al modello non solo di "comprendere" o "comprendere" i contenuti audio e video, ma di pianificare ulteriormente attività, chiamare strumenti e completare il lavoro effettivo dopo aver compreso queste informazioni.
In termini di capacità audio, le prestazioni di Qwen3.8-Omni-Flash sono particolarmente eccezionali. Secondo i dati rilasciati da Qwen, questo modello ha superato Gemini 3.8 Flash in alcuni test di benchmark audio. Ad esempio, nel test di chiamata dello strumento multimodale WildClawBench-MM, Qwen3.8-Omni-Flash ha ottenuto 71,0 punti, mentre Gemini 3.8 Flash ha ottenuto 58,9 punti; nel test DailyOmni, Qwen ha ottenuto 85,1 punti e Gemini 84,0 punti; in SpotSoundBench i due hanno totalizzato rispettivamente 67,2 punti e 39,7 punti; nel test MMAU hanno ottenuto 81,8 punti e 76,9 punti.
Anche il riconoscimento vocale delle conferenze con più relatori è al centro di questo aggiornamento. I dati del test AliMeeting rilasciati da Qwen mostrano che il tasso di errore dell'altoparlante DER di Qwen3.8-Omni-Flash è 3,35 e il tasso di errore della parola cpWER con attribuzione dell'altoparlante è 17,18, mentre la generazione precedente Qwen3.5-Omni-Plus è rispettivamente 88,11 e 89,61. Ciò significa che il nuovo modello cambia in modo significativo in questo test.
Tuttavia, Qwen3.8-Omni-Flash non è superiore a Gemini 3.8 Flash in tutti i progetti. Ad esempio, nel test AgenticVBench, Gemini 3.8 Flash ha ottenuto 45,0 punti e Qwen 36,8 punti; in OmniGAIA hanno ottenuto rispettivamente 78,6 e 74,0 punti. Anche in alcuni test di comprensione video i Gemelli hanno mantenuto il loro vantaggio. Pertanto, l'enfasi di Qwen sull'"avvicinamento ai Gemelli" si riflette maggiormente nelle capacità audio, audio e video complessive e non significa un vantaggio generale in tutti i progetti multimodali.
Un altro cambiamento importante in Qwen3.8-Omni-Flash è il prezzo. Qwen afferma che il costo orario stimato per l'input audio è diminuito di oltre il 98% e il costo orario per l'input audio e video è diminuito di oltre il 93% rispetto al modello precedente. Secondo il metodo di calcolo ufficiale, il cosiddetto costo "orario" viene calcolato moltiplicando per 30 il prezzo di elaborazione di due minuti di materiale, in cui il video adotta la condizione di input di 720p e 1 fotogramma al secondo.
L'attuale prezzo regionale internazionale annunciato da Alibaba Cloud è di 0,15 dollari per milione di token immessi, il token di input che arriva nella cache è di 0,016 dollari e il token di output per milione è di 0,47 dollari. I prezzi nella Cina continentale e in alcune altre regioni possono variare. Poiché audio e video possono essere utilizzati direttamente come input del modello, questa struttura di prezzi è particolarmente adatta per scenari quali registrazione di riunioni, analisi audio prolungate, revisione video, generazione di sottotitoli ed elaborazione di grandi quantità di contenuti multimediali.
La finestra di contesto da 1 milione di token amplifica ulteriormente questo vantaggio. La lunghezza massima di input di Qwen3.8-Omni-Flash è vicina a 992.000 token, la lunghezza massima di input in modalità di pensiero è di circa 984.000 token e la lunghezza massima di output raggiunge 131.000 token. Ciò significa che gli sviluppatori possono consegnare direttamente contenuti audio o video su larga scala al modello per l'elaborazione, senza dover suddividere ed estrarre frequentemente fotogrammi come in passato, e quindi utilizzare più modelli per completare rispettivamente il riconoscimento vocale, la comprensione visiva e il ragionamento testuale.
Le informazioni ufficiali di Alibaba Cloud mostrano che Qwen3.8-Omni-Flash può gestire l'input audio in 113 lingue e dialetti e supporta l'analisi audio spaziale. Attraverso parametri rilevanti, il modello può gestire audio stereo a due canali e spaziale a quattro canali. Allo stesso tempo, il modello supporta la chiamata di funzioni, la ricerca di rete, la memorizzazione nella cache del contesto e altre funzionalità e può essere utilizzato direttamente in flussi di lavoro degli agenti più complessi.
Dal punto di vista della direzione dell'applicazione, questa volta il team di Qwen si concentra sulla "consegna intelligente". Ad esempio, il modello può analizzare video lunghi, individuare i contenuti chiave e richiamare ulteriori strumenti per completare attività quali editing video, organizzazione dei contenuti, riepilogo della riunione e generazione di sottotitoli. Qwen ha inoltre annunciato Qwen-MM-Plugins per lo sviluppo di agenti multimodali e prevede di lanciare Qwen-Live-Harness per aiutare gli sviluppatori a creare ulteriormente applicazioni di agenti intelligenti basate su input audio e video.
Rispetto alla generazione precedente Qwen3.5-Omni, l'obiettivo di questo aggiornamento non è solo migliorare la precisione del riconoscimento nel senso tradizionale, ma provare a cambiare il modo in cui viene utilizzata l'intelligenza artificiale audio e video. In passato, le applicazioni multimodali richiedevano solitamente l'estrazione di fotogrammi video e la trascrizione dell'audio, quindi il trasferimento dei diversi risultati al modello linguistico per l'elaborazione; Qwen3.8-Omni-Flash tenta di unificare il più possibile questi collegamenti in un modello full-modale nativo e utilizza 1 milione di contesti token per elaborare direttamente contenuti originali più lunghi.
Qwen3.8-Omni-Flash attualmente fornisce servizi tramite Alibaba Cloud Bailian, supportando regioni come Pechino, Singapore, Hong Kong, Cina, Tokyo, Giappone, Francoforte, Germania e Virginia, Stati Uniti. Il modello in sé non apre direttamente i pesi come alcuni modelli precedenti di Qwen. Questa volta Alibaba apre principalmente i plug-in multimodali di supporto e i relativi strumenti di sviluppo.
Nel complesso, il nucleo di questo aggiornamento Qwen3.8-Omni-Flash non è solo migliorare i punteggi dei modelli, ma ridurre contemporaneamente i costi di elaborazione dei video dei bassi, espandere la scala del contesto e combinare la comprensione di audio e video con l'invocazione degli strumenti. In particolare, il costo dell'input audio è stato ridotto di oltre il 98%. Se il costo di utilizzo effettivo raggiungerà il livello di calcolo ufficiale, ciò renderà più semplice l’analisi automatica su larga scala di registrazioni di riunioni a lungo termine, podcast, trasmissioni in diretta e materiali video e intensificherà ulteriormente la concorrenza tra Qwen e modelli multimodali come Google Gemini.
Commenti