OpenAI apre agli sviluppatori lo stesso modello vocale GPT-Live-1 di ChatGPT. Il prezzo dell'API è di 0,05 USD al minuto.

📅 2026-09-11

Riassunto:

OpenAI ha recentemente annunciato che GPT-Live-1, attualmente utilizzato per la funzione vocale ChatGPT, sarà ufficialmente aperto agli sviluppatori. Gli sviluppatori possono ora integrare questo modello vocale nelle proprie applicazioni e nei processi aziendali tramite API per creare assistenti vocali full-duplex in grado di ascoltare gli utenti in tempo reale e rispondere allo stesso tempo. Il prezzo front-end vocale di questo modello è di 0,05 USD al minuto e il modello utilizzato in background per ragionamenti complessi deve essere fatturato separatamente in base al prezzo del modello corrispondente.

1789093911_chatgpt_voice.webp

GPT-Live-1 è una nuova generazione di modelli vocali in tempo reale lanciati quest'anno da OpenAI. La sua più grande caratteristica è la sua architettura full-duplex. L'intelligenza artificiale vocale tradizionale di solito deve completare le tre fasi di riconoscimento vocale, inferenza del modello linguistico e sintesi vocale in sequenza. Solo dopo che l'utente ha finito di parlare il sistema può avviare l'elaborazione e generare risposte. GPT-Live-1, d'altra parte, può generare output vocale mentre ascolta l'utente parlare, in modo da poter gestire interruzioni, pause, echi e conversazioni rapide avanti e indietro in modo più naturale.

Ciò significa che gli utenti non devono attendere che l'IA finisca di parlare completamente prima di continuare a parlare. Se l'utente cambia idea, aggiunge informazioni o interrompe direttamente, GPT-Live-1 può adattare il suo comportamento in tempo in base alla conversazione in corso. Il modello può anche indicare quando continuare a parlare, quando fare una pausa, quando continuare ad ascoltare e quando utilizzare gli strumenti.

OpenAI ha affermato che questa architettura può ridurre significativamente il ritardo nell'interazione vocale e risolvere i problemi di connessione che tendono a verificarsi nelle conversazioni reali nella tradizionale pipeline "riconoscimento vocale + modello linguistico ampio + sintesi vocale". Poiché GPT-Live-1 gestisce da solo sia l'audio in ingresso che quello in uscita, gli sviluppatori non hanno più bisogno di coordinare il passaggio complesso tra più modelli indipendenti.

Nel test pubblicato da OpenAI, le prestazioni di GPT-Live-1 nel test Full Duplex Bench sono state superiori di 30 punti percentuali rispetto a quelle di GPT-Realtime-2.1, soprattutto in termini di ritardo nel turno e comportamento interattivo. Se abbinato a GPT-6 Astra con intensità di inferenza media, GPT-Live-1 ha ottenuto il primo posto anche nel test Tau3. Tau3 viene utilizzato principalmente per valutare la capacità degli agenti vocali di completare attività end-to-end.

Un'altra caratteristica importante di GPT-Live-1 è che non è responsabile di tutto il lavoro di ragionamento complesso. OpenAI separa il modello vocale responsabile dell'ascolto, della conversazione e dell'interazione in tempo reale dal modello di fondo responsabile del ragionamento profondo. Quando gli utenti pongono domande che richiedono ricerca, analisi complesse o attività lunghe, GPT-Live-1 può affidare queste attività al modello in background continuando a mantenere una comunicazione vocale naturale con l'utente.

Gli sviluppatori sono quindi liberi di scegliere modelli backend in base alle specifiche esigenze aziendali. Ad esempio, per un gran numero di compiti semplici come le prenotazioni e gli aggiornamenti degli ordini, è possibile utilizzare modelli più rapidi ed economici; per i problemi complessi dei clienti, possono essere gestiti da modelli di inferenza più forti. Questa architettura consente agli sviluppatori di trovare un equilibrio tra reattività, capacità di ragionamento e costo di utilizzo.

OpenAI ha affermato che questo design disaccoppiato consente inoltre a GPT-Live-1 di continuare a comunicare con gli utenti mentre eseguono attività in background, invece di lasciare che gli utenti debbano affrontare un lungo periodo di attesa silenziosa. Il modello può continuare una conversazione naturale mentre completa un lavoro più complesso in background, quindi riportare i risultati alla conversazione corrente una volta completata l'attività.

Le applicazioni pratiche stanno già iniziando a emergere. I primi esempi dimostrati da OpenAI includono servizi vocali come Yelp Host e Hatch e la piattaforma di apprendimento delle lingue Speak. Speak ha scoperto nelle prime valutazioni che, rispetto ai precedenti sistemi vocali a turni, GPT-Live-1 può dare agli studenti di lingue più tempo per pensare, riducendo il numero di interruzioni proattive del sistema per gli utenti di quasi l'80%.

Per le aziende, questa funzionalità è particolarmente adatta per il servizio clienti, il servizio clienti telefonico, le prenotazioni e altri scenari che richiedono un'interazione vocale continua. GPT-Live-1 supporta nativamente scenari telefonici, quindi gli sviluppatori possono utilizzarlo per creare agenti vocali full-duplex in grado di rispondere e gestire le chiamate telefoniche, come prenotazioni di ristoranti, assistenza clienti e altre attività che richiedono comunicazioni in tempo reale.

GPT-Live-1 fornisce inoltre testo trascritto con riconoscimento vocale automatico nativo e testo di risposta modello e migliora la comprensione delle combinazioni alfanumeriche, supportando al tempo stesso le funzioni di distorsione delle parole chiave. Sebbene non sia un modello a turni nel senso tradizionale, supporta comunque il rilevamento delle svolte in modo nativo. Pertanto, se gli sviluppatori hanno bisogno di controllare chiaramente quando l'utente finisce di parlare e quando il sistema inizia a rispondere, possono comunque progettare le loro applicazioni attorno a turni di dialogo chiari.

GPT-Live-1 è stato ottimizzato anche per scene con ambienti rumorosi di sottofondo. Il modello può distinguere meglio tra parlato dell'utente, rumore di fondo e silenzio. Non interromperà frequentemente le conversazioni a causa dei suoni nell'ambiente circostante, né ricorderà costantemente agli utenti quando stanno solo pensando brevemente. Questa funzionalità è particolarmente importante per le telefonate, il servizio clienti e gli assistenti vocali mobili in ambienti reali.

OpenAI ha anche ampliato la selezione di suoni disponibile per GPT-Live-1. Rispetto al numero relativamente limitato di voci in tempo reale precedentemente disponibili, la nuova versione offre voci più diversificate e copre una gamma più ricca di accenti, dialetti e lingue. OpenAI afferma che continuerà ad aggiungere voci e lingue disponibili nei prossimi mesi.

In termini di distribuzione del modello, gli sviluppatori non devono affidare tutte le attività a GPT-Live-1. OpenAI spera di utilizzarlo come front-end responsabile dell'interazione vocale in tempo reale, svolgendo un lavoro più complesso attraverso modelli di background e strutture di agenti. Questo approccio consente inoltre agli sviluppatori di combinare diversi modelli in base alle effettive esigenze dei diversi compiti.

Ad esempio, gli sviluppatori possono lasciare che GPT-Live-1 sia responsabile della ricezione delle richieste vocali degli utenti, del mantenimento di conversazioni naturali e della gestione delle interruzioni, quindi affidare le domande che richiedono un ragionamento complesso al modello in background; una volta che il modello in background ha completato il lavoro, GPT-Live-1 converte i risultati in risposte vocali naturali. Questo meccanismo si applica anche alle applicazioni che necessitano di chiamare strumenti esterni.

OpenAI ha anche dimostrato come combinare GPT-Live-1 con strumenti come Codex. Gli sviluppatori possono lasciare che il modello vocale riceva le attività proposte dall'utente, quindi trasferisca il contesto rilevante a strumenti in background come Codex per l'elaborazione, e quindi restituisca i risultati dell'elaborazione a GPT-Live-1, che continuerà a comunicare con l'utente tramite voce.

In termini di prezzo, GPT-Live-1 è ora ufficialmente disponibile tramite l'API OpenAI e il front-end vocale addebita $ 0,05 al minuto. È importante notare che questo è solo il costo del livello vocale in tempo reale. Se lo sviluppatore dota GPT-Live-1 di un modello di inferenza in background, il costo della chiamata al modello in background deve essere calcolato separatamente in base al prezzo del modello corrispondente.

Ciò significa che per le applicazioni aziendali che richiedono un numero elevato di chiamate vocali, il costo effettivo non è solo di 0,05 dollari al minuto, ma è composto dal tempo di connessione vocale e dal consumo di inferenza del modello in background. Tuttavia, gli sviluppatori possono controllare il costo complessivo in base alla complessità dell'attività scegliendo diversi modelli back-end.

L'apertura di GPT-Live-1 significa anche che OpenAI sta estendendo ulteriormente la tecnologia alla base della modalità vocale ChatGPT dai prodotti di consumo all'ecosistema degli sviluppatori. In precedenza, GPT-Live-1 esisteva principalmente come funzionalità di interazione vocale di ChatGPT. Ora gli sviluppatori possono utilizzare direttamente tecnologie simili per creare le proprie applicazioni e agenti vocali.

Da un punto di vista tecnico, OpenAI spera che GPT-Live-1 non solo risolva "permettere all'intelligenza artificiale di parlare", ma consenta all'intelligenza artificiale di partecipare veramente a conversazioni naturali continue, in tempo reale e interrompibili. Suddividendo ascolto, conversazione, interazione in tempo reale e ragionamento profondo, OpenAI tenta di ottenere allo stesso tempo una latenza vocale inferiore, un'esperienza di conversazione più naturale e capacità di elaborazione delle attività in background più forti.

Poiché gli agenti vocali passano gradualmente dalle semplici domande e risposte vocali ad attività complesse come il servizio clienti telefonico, le prenotazioni, l'educazione linguistica, l'elaborazione aziendale e la capacità di chiamare autonomamente gli strumenti per completare le attività, aumenta anche l'importanza dei modelli vocali in tempo reale. L'API aperta di GPT-Live-1 significa che gli sviluppatori possono ora incorporare direttamente l'attuale generazione di tecnologia vocale in tempo reale utilizzata da ChatGPT nei propri prodotti e il prezzo del livello vocale di 0,05 dollari al minuto consente inoltre a questa funzionalità di entrare ufficialmente nella fase di applicazione commerciale.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento