Microsoft Foundry si unisce all'agente vocale nativo in tempo reale per sfidare Google Gemini Live

📅 2026-09-25

Riassunto:

Microsoft sta rafforzando ulteriormente le funzionalità vocali in tempo reale della piattaforma Foundry, fornendo agli sviluppatori agenti vocali nativi in ​​grado di eseguire direttamente input e output vocali, rendendo più semplice per le aziende creare esperienze di intelligenza artificiale conversazionale in tempo reale simili a Google Gemini Live.

1790309180_microsoft_foundry_voice_agents.webp

La novità principale dell'aggiornamento di Microsoft è che il servizio Foundry Agent inizia a supportare funzionalità vocali native in tempo reale. Diversamente dal processo degli agenti di intelligenza artificiale tradizionali che prima convertono il parlato in testo, quindi lo consegnano al modello testuale per l'elaborazione e infine convertono nuovamente il testo in parlato, l'architettura vocale nativa può consentire direttamente al modello vocale in tempo reale di elaborare l'input vocale dell'utente e generare una risposta vocale, riducendo così i collegamenti intermedi e i conseguenti ritardi.

Per gli utenti, ciò significa che gli agenti IA possono impegnarsi in conversazioni continue in modo più naturale. Gli utenti non devono attendere il completamento del riconoscimento vocale o la generazione di una risposta testuale completa da parte del modello prima di avviare la sintesi vocale. Il sistema può essere più vicino al metodo di comunicazione in tempo reale tra le persone e può gestire aspetti chiave dell'interazione vocale come l'interruzione e il giudizio di turno.

Le funzionalità di Microsoft si basano sull'API Voice Live. Questa interfaccia integra funzioni come riconoscimento vocale, intelligenza artificiale generativa, sintesi vocale, rilevamento delle svolte ed elaborazione delle interruzioni in un'interfaccia vocale unificata in tempo reale, consentendo agli sviluppatori di aggiungere funzionalità di interazione vocale in tempo reale ai propri agenti IA senza dover creare più componenti vocali separatamente.

Per le aziende che hanno utilizzato il servizio Foundry Agent per creare agenti IA, ciò significa che gli agenti originali basati su testo possono ottenere ulteriori funzionalità di interazione vocale, continuando a utilizzare l'invocazione dello strumento originale, la knowledge base, la memoria, la protezione della sicurezza dei contenuti e le funzionalità di integrazione di dati e servizi a livello aziendale.

Microsoft sottolinea in particolare che l'agente vocale non è solo un chatbot in grado di "leggere le risposte", ma può chiamare strumenti ed eseguire attività durante la comunicazione vocale in tempo reale. Ad esempio, le aziende possono utilizzare questa tecnologia per creare sistemi di servizio clienti che consentano agli utenti di comunicare direttamente con gli agenti AI al telefono; può essere utilizzato anche per servizi senza barriere, applicazioni voice-first e vari sistemi aziendali interni che richiedono un'interazione vocale naturale.

In termini di architettura tecnica, Foundry attualmente supporta due principali percorsi di agenti vocali. Una è la pipeline vocale tradizionale, che converte il parlato dell'utente in testo, quindi lo trasmette al modello testuale per l'inferenza e infine converte il testo generato in parlato. L'altro è la sintesi vocale nativa su cui ci si concentra in questo momento, ovvero l'architettura della sintesi vocale. Il modello vocale in tempo reale elabora direttamente l'input vocale e genera l'output vocale.

Il più grande vantaggio dell'architettura vocale nativa è che riduce la latenza mantenendo al tempo stesso il tono, le pause e il ritmo di comunicazione delle conversazioni naturali. Per gli scenari che richiedono una comunicazione continua, questo metodo è più vicino a una conversazione reale in tempo reale rispetto alla tradizionale soluzione multistadio di "riconoscimento vocale → modello testuale → sintesi vocale".

Microsoft continua inoltre a migliorare le funzionalità di interazione in tempo reale dell'API Voice Live. Aggiornamenti recenti hanno aggiunto nuovi tipi di parlato nativo in tempo reale e funzionalità ulteriormente migliorate come la cancellazione dell'eco, il rilevamento intelligente della chiusura e l'invocazione di strumenti paralleli. La cancellazione dell'eco è particolarmente adatta per gli agenti vocali che funzionano su hardware personalizzato o collegamenti audio non standard. Consente al sistema di fare riferimento al suono effettivamente riprodotto dal client, riducendo così il problema del riconoscimento errato dopo che l'IA ha sentito la propria voce.

Oltre a dare voce a se stessa, Microsoft sta anche rafforzando il posizionamento di Foundry come piattaforma operativa e di sviluppo di agenti IA di livello aziendale. Foundry Agent Service può essere responsabile della gestione del ciclo di vita degli agenti intelligenti e fornire sicurezza a livello aziendale, controllo delle autorizzazioni, isolamento della rete, monitoraggio delle operazioni e funzionalità di valutazione. In questo modo, le aziende non hanno bisogno di costruire da zero un’infrastruttura per il funzionamento, il monitoraggio e la comunicazione vocale degli agenti IA.

La mossa di Microsoft è ovviamente rivolta anche a Gemini Live, che Google ha continuamente potenziato negli ultimi anni. Gemini Live è diventato un prodotto importante per Google per dimostrare ai consumatori le funzionalità di intelligenza artificiale vocale in tempo reale, mentre Microsoft sottolinea la fornitura di funzionalità vocali in tempo reale simili direttamente agli sviluppatori aziendali, consentendo alle aziende di creare un'intelligence vocale esclusiva basata sui propri dati, strumenti e processi aziendali.

Il posizionamento dei due quindi non è esattamente lo stesso. Gemini Live fornisce principalmente un'esperienza vocale AI direttamente utilizzabile per gli utenti ordinari, mentre Microsoft Foundry è più orientato alle aziende e agli sviluppatori. L'obiettivo è consentire alle aziende di integrare funzionalità vocali in tempo reale nel servizio clienti, nei sistemi telefonici, nelle attività interne e in altre applicazioni professionali.

Negli ultimi anni Microsoft ha promosso lo sviluppo di agenti IA da semplici chatbot a sistemi in grado di eseguire attività in modo autonomo. Con l'aggiunta delle funzionalità vocali a questo sistema, l'interazione tra utenti e agenti si è gradualmente estesa dall'input da tastiera a conversazioni più naturali in tempo reale. Gli agenti non solo possono rispondere alle domande, ma possono anche richiamare strumenti, accedere ai dati aziendali e completare attività specifiche durante le conversazioni.

Attualmente, Microsoft sta gradualmente integrando funzionalità come Foundry Agent Service, Voice Live e agenti gestiti nella stessa piattaforma di intelligenza artificiale aziendale. Man mano che queste tecnologie maturano, l’infrastruttura di cui le aziende hanno bisogno per sviluppare e mantenere se stesse per creare servizi vocali ai clienti, agenti telefonici, assistenti vocali e altri servizi di intelligenza artificiale in tempo reale sarà ulteriormente ridotta.

Ciò significa anche che la concorrenza per gli assistenti vocali IA si sta spostando dal semplice confronto dei modelli "se possono chattare" al confronto tra chi può fornire un'interazione vocale a latenza inferiore, funzionalità di chiamata degli strumenti più complete, un'infrastruttura di livello aziendale più affidabile e un ambiente di sviluppo più conveniente. L'aggiunta da parte di Microsoft di un agente vocale nativo in tempo reale a Foundry è un passo importante nell'ulteriore espansione del layout dell'agente vocale nel mercato dell'intelligenza artificiale aziendale.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento