Riassunto:
Google ha recentemente rilasciato Gemini 3.5 Transcribe, l'ultimo modello di sintesi vocale della serie Gemini, definendolo il modello di riconoscimento vocale più accurato della serie. Questo modello è aperto a sviluppatori, aziende e utenti ordinari e si concentra sul miglioramento delle capacità di traslitterazione in ambienti rumorosi, termini professionali complessi ed espressioni parlate naturali.

Secondo i rapporti, Gemini 3.5 Transcribe può gestire meglio il rumore di fondo e il vocabolario complesso in ambiti professionali. Google ha affermato che il nuovo modello ha apportato miglioramenti alle prestazioni dell'app Gemini sulla piattaforma macOS e alla funzione Rambler della tastiera Gboard sulla piattaforma Android. Gli sviluppatori possono utilizzare questo modello per creare applicazioni come agenti vocali, strumenti di sottotitoli in tempo reale e processi di analisi post-chiamata.
Google ha affermato che Gemini 3.5 Transcribe è progettato per catturare i modelli di linguaggio naturale degli utenti per comprendere in modo più accurato l'intento semantico, identificare il vocabolario personalizzato e aiutare gli utenti a completare le attività tramite la voce.
A livello funzionale, il nuovo modello aggiunge una serie di funzionalità di ottimizzazione, tra cui l'autocorrezione automatica, l'eliminazione delle parole di riempimento pronunciate come "um" e "ah" e la formattazione automatica del testo di output. Allo stesso tempo, può anche delegare attività più complesse come l'analisi di file e la generazione di immagini ad altri modelli Gemini per creare un'esperienza di collaborazione multi-modello più completa.
In termini di precisione, Google ha sottolineato che il tasso medio di errori di parola di Gemini 3.5 Transcribe è del 4,0% negli scenari di riconoscimento vocale in streaming e può essere ridotto al 2,6% in scenari non di streaming. Il modello offre prestazioni di trascrizione migliori in ambienti rumorosi e può identificare in modo più accurato le informazioni chiave composte da lettere e numeri come numeri di ordine e codici postali.

In termini di supporto linguistico, Gemini 3.5 Transcribe copre attualmente 85 lingue e supporta accenti regionali e diversi dialetti. Per l'audio preregistrato, può eseguire il riconoscimento dell'attribuzione vocale con timestamp per un massimo di tre oratori; inoltre, il modello può adattarsi ai vocabolari definiti dall'utente per identificare termini professionali, ortografie speciali e nomi di settore.
Gemini 3.5 Transcribe è attualmente disponibile in anteprima pubblica tramite l'API Gemini in Google AI Studio e Google Antigravity. Gli utenti ordinari possono sperimentare le funzioni correlate su piattaforme Android e macOS. Google prevede inoltre di introdurlo nel browser Chrome, dove gli utenti possono inserire il testo direttamente tramite la voce nella casella di input di qualsiasi pagina web.
Recentemente, Google ha continuato ad accelerare il progresso della linea di prodotti Gemini. L'azienda aveva precedentemente lanciato Gemini 3.7 Flash per unirsi alla sempre più agguerrita competizione sui prezzi per i modelli AI; Gemini in Chrome per Android è stato aperto anche a tutti gli utenti negli Stati Uniti e Gemini Assistant è entrato anche nella nuova generazione di taxi a guida autonoma di Waymo.
Commenti