Microsoft lancia il modello di trascrizione e sintesi vocale in tempo reale MAI-Transcribe-2-Streaming, classificandosi al primo posto nell'elenco dei riconoscimenti in streaming

📅 2026-10-02

Riassunto:

Microsoft ha lanciato tre nuovi modelli per l'interazione vocale in tempo reale, ovvero il modello di sintesi vocale MAI-Transcribe-2-Streaming e i modelli di sintesi vocale MAI-Voice-2.1 e MAI-Voice-2.1-Flash. Microsoft spera che gli sviluppatori li combinino per creare assistenti vocali e agenti conversazionali in grado di elaborare durante l'ascolto e rispondere istantaneamente con un parlato naturale.

MAI-Transcribe-2-Streaming è diverso dal precedente MAI-Transcribe-2 che può elaborare solo file di registrazione. Può ricevere flussi audio in input continui e iniziare a generare testo in scena prima che l'oratore abbia finito di parlare. Continuerà a essere rivisto man mano che verrà fornito più contesto e alla fine presenterà risultati stabili. Microsoft ha affermato che il modello supporta 60 lingue ed è in grado di riconoscere le lingue in modo continuo e automatico; Si presuppone che il primo batch di riconoscimento venga visualizzato poco più di 100 millisecondi dopo la ricezione dell'audio ed è adatto per scenari quali agenti vocali, servizio clienti, sottotitoli per conferenze e aule e input vocale. I test interni di Microsoft su dettatura e sottotitoli mostrano che il testo appare circa due volte più velocemente rispetto al concorrente più vicino, un confronto basato sulle recensioni dell'azienda.

Il benchmark della trascrizione in streaming di Artificial Analysis colloca il modello al primo posto in termini di precisione del testo finale e graduale. I risultati del test pubblicati indicano che il tasso di errore della parola trascritta finale era di circa il 2,5% e che il testo finale è stato fornito circa 0,13 secondi dopo il rilevamento della fine del discorso. L'elenco confrontava 38 modelli dell'epoca, testava circa 8 ore di audio e copriva tre tipologie di corpus: AA-AgentTalk, VoxPopuli ed Earnings22, che rappresentavano rispettivamente il 50%, 25% e 25% del peso complessivo. Minore è il tasso di errore delle parole, meglio è. Questo risultato illustra le prestazioni del modello su questa serie di benchmark e non significa che la stessa precisione possa essere raggiunta in tutte le lingue, ambienti rumorosi e applicazioni del mondo reale.

MAI-Transcribe-2-Streaming è attualmente in vendita a $ 0,54 l'ora di audio e l'offerta dura fino alla fine del 2026; in confronto, MAI-Transcribe-2 non in streaming veniva precedentemente pubblicizzato a $ 0,10 l'ora. La versione in tempo reale è più adatta per l'interazione continua, mentre la versione batch serve per la registrazione della trascrizione audio. I prezzi dei due non possono essere considerati semplicemente come un confronto diretto con lo stesso metodo di utilizzo.

Il nuovo modello di sintesi vocale MAI-Voice-2.1 supporta 23 lingue e 26 varianti regionali, consentendo alla stessa voce sintetizzata di passare da una lingua all'altra mantenendo l'identità di chi parla e adottando l'accento locale della lingua corrispondente. Il prezzo è di 22 dollari per 1 milione di caratteri. MAI-Voice-2.1-Flash per richieste a bassa latenza e su larga scala supporta la stessa lingua. Microsoft afferma che può generare 45 secondi di audio con un ritardo end-to-end di circa 150 millisecondi. La velocità di inferenza del modello è aumentata del 55% e il prezzo è inferiore di circa il 60% rispetto a modelli comparabili. Il suo prezzo è di $ 15 per 1 milione di caratteri. Quest'ultima serie di vantaggi in termini di velocità e prezzo sono tra i confronti pubblicati da Microsoft.

Entrambi i modelli vocali supportano la clonazione vocale in tempo reale in più lingue, ma solo con l'uso di voci di riferimento autorizzate e consentite. La documentazione Microsoft elenca la funzionalità come accesso limitato, con una raccomandazione audio di riferimento da 5 a 60 secondi e protezioni contro gli abusi. MAI-Voice-2.1 è adatto a contenuti più lunghi, narrazioni e audiolibri, mentre Flash è più adatto a scenari in tempo reale come agenti vocali, assistenti e servizio clienti.

Tutti e tre i modelli possono essere utilizzati tramite Microsoft Foundry, MAI Playground e Vercel; i due modelli Voice sono stati collegati anche a OpenRouter e possono essere chiamati tramite Azure Voice Live. Il supporto LiveKit dovrebbe essere lanciato più tardi. La documentazione di Microsoft Azure attualmente etichetta questi modelli come anteprima pubblica, affermando che non esiste un accordo sul livello di servizio e che non sono consigliati per l'uso diretto nei carichi di lavoro di produzione.

Ulteriori informazioni:

https://microsoft.ai/news/our-first-streaming-transcription-model/

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento