Riassunto:
Google ha annunciato di aver lanciato ufficialmente la funzione "Live Avatar" (essere umano digitale in tempo reale) nella piattaforma aziendale Gemini Enterprise. Questa tecnologia è profondamente integrata con l'ultima architettura del modello di grandi dimensioni Gemini 3.8 Live di Google. Basato sul ritardo quasi zero originale e sulla conversazione vocale estremamente fluida, introduce per la prima volta funzionalità di generazione video generativa quasi in tempo reale, consentendo all'intelligenza artificiale conversazionale di avere un'immagine visiva dinamica in grado di "ascoltare, guardare e parlare allo stesso tempo".

Secondo l'introduzione ufficiale, Gemini 3.8 Live Live Avatar è progettato per creare un assistente di servizio virtuale più intuitivo e coinvolgente per i clienti aziendali. Sincronizzando accuratamente il flusso audio con il modello di generazione video sottostante, il sistema può ottenere una sincronizzazione labiale di alta precisione, cambiamenti naturali delle espressioni facciali e una conversione fluida dei dialoghi tra lingue diverse. Attualmente, il sistema umano digitale supporta nativamente fino a 97 lingue e non si verificherà alcuna distorsione video o deriva facciale quando si passa da una lingua all’altra durante una conversazione.
Oltre alle innovazioni visive, la piattaforma è dotata anche di potenti funzionalità di chiamata asincrona degli strumenti. Pur mantenendo una conversazione naturale e coerente con gli utenti, gli esseri umani digitali possono chiamare silenziosamente varie API esterne e interfacce dati aziendali in background per gestire complesse attività in più fasi come la registrazione del check-in in hotel e la compilazione dei documenti di richiesta di indennizzo assicurativo, dicendo completamente addio al "crash" o al lungo fenomeno di attesa silenziosa che si verificava quando l'intelligenza artificiale elaborava attività in background in passato. Allo stesso tempo, in combinazione con la fotocamera e la funzione di condivisione dello schermo del dispositivo terminale, l'uomo digitale può anche fornire una comprensione visiva in tempo reale e una guida interattiva degli oggetti fisici o delle interfacce software visualizzate dall'utente.
In termini di sicurezza e conformità, al fine di prevenire il rischio di deepfake di intelligenza artificiale e furto di identità, Google ha creato più linee di difesa di sicurezza per Live Avatar. Per impostazione predefinita, il sistema apre agli utenti aziendali solo la libreria di immagini umane digitali che è stata preimpostata dalla revisione ufficiale, mentre il permesso di personalizzare immagini esclusive del marchio o volti specifici è sottoposto a un rigido meccanismo di revisione della whitelist. Inoltre, tutti i flussi vocali e video dinamici in tempo reale generati dal sistema sono stati incorporati con filigrane digitali SynthID invisibili e non manomettebili per garantire la trasparenza e la tracciabilità dei contenuti generati dall'intelligenza artificiale.
Attualmente, le funzioni Gemini 3.8 Live e Live Avatar sono state ufficialmente aperte ai clienti in abbonamento di livello aziendale attraverso i nodi di servizio dei data center statunitensi ed europei e viene fornito contemporaneamente il supporto per l'accesso alle API degli sviluppatori. Gli analisti del settore hanno sottolineato che l'integrazione della tecnologia video generativa direttamente nel modello vocale sottostante non solo elimina l'elevata latenza causata dalle tradizionali suite di rendering video, ma segnala anche che il servizio clienti virtuale basato sull'intelligenza artificiale e i terminali interattivi intelligenti stanno entrando in una nuova era di "dialogo visivo con persone reali e in tempo reale".
Commenti