Google DeepMind presenta Gemini 3.8 Live con Live Avatar
Punti chiave
- •Live Avatar consente agli agenti aziendali di ascoltare, vedere e rispondere tramite audio e video sincronizzati quasi in tempo reale.
- •Il sistema può eseguire strumenti e recuperare informazioni in background senza interrompere una conversazione in corso.
- •Live Avatar supporta la sincronizzazione multilingue da parlato a parlato in 97 lingue, incluso il cambio di lingua durante la conversazione.
- •Le organizzazioni possono selezionare avatar predefiniti, mentre la creazione di avatar personalizzati da immagini di riferimento è limitata alle imprese autorizzate.
- •Il watermark SynthID è incorporato nell'audio e nel video generati per aiutare a identificare i contenuti prodotti dall'AI.

Google DeepMind ha presentato Gemini 3.8 Live con Live Avatar il 24 settembre 2026, aggiungendo una presenza visiva quasi in tempo reale alla sua AI conversazionale. La funzionalità combina le capacità di dialogo live native di Gemini con streaming video a bassa latenza per creare interazioni più naturali e intuitive per le imprese e i loro utenti.
L'annuncio è stato firmato da Shuo-yiin Chang, ricercatore scientifico, e CJ Zheng, ingegnere del software, a nome del Gemini Audio Team. Esso segue il lancio della settimana scorsa di Gemini 3.8 Live.
Secondo Google DeepMind, Live Avatar abbina la generazione video quasi in tempo reale alla voce, consentendo al sistema di ascoltare, vedere e parlare attraverso una persona visiva dinamica. La funzionalità è progettata con sincronizzazione labiale precisa, espressioni facciali naturali e alternanza fluida dei turni di parola, permettendo di rendere i servizi virtuali più interattivi. Gli usi potenziali descritti dall'azienda includono il servizio clienti e le guide interattive.
Gemini 3.8 Live con Live Avatar è disponibile a partire da oggi in Gemini Enterprise. L'annuncio originale è disponibile sul blog di Google DeepMind.
Conversazioni multimodali
Google DeepMind ha dichiarato che la conversazione è intrinsecamente multimodale, coinvolgendo ascolto, attenzione visiva, parlato ed espressioni facciali. Live Avatar porta queste capacità agli agenti aziendali elaborando simultaneamente input visivi e audio e generando risposte che combinano audio e video espressivi.
L'azienda ha presentato la funzionalità come capace di elaborare ciò che vede e sente quasi in tempo reale, per poi rispondere tramite audio e video a supporto di conversazioni più naturali. Per gli scenari di servizio clienti e guide interattive citati da Google DeepMind, l'effetto pratico è un agente virtuale che reagisce a che gli viene mostrato e risponde con voce e segnali facciali in un'unica conversazione.
Esecuzione di strumenti in background
Live Avatar utilizza inoltre le capacità di ragionamento di Gemini e le chiamate asincrone di strumenti. Può avviare chiamate di strumenti e recuperare dati in background mentre prosegue una conversazione attiva. Ciò consente di gestire compiti complessi senza interrompere il dialogo.
Google DeepMind ha indicato il check-in di un ospite in hotel come esempio di attività in cui gli strumenti possono girare in background mentre la conversazione continua. Per le imprese, il valore è la continuità: i clienti vivono una conversazione ininterrotta mentre il recupero dei dati e l'esecuzione delle attività avvengono dietro le quinte.
Supporto per 97 lingue
La funzionalità include la sincronizzazione nativa multilingue da parlato a parlato. Google DeepMind ha dichiarato che Live Avatar può adattare dinamicamente la sincronizzazione labiale e le espressioni facciali mentre passa tra 97 lingue, senza degradare la fedeltà video né causare deriva visiva.
L'azienda ha anche dimostrato il cambio di lingua a metà conversazione, con la sincronizzazione labiale e le espressioni dell'avatar che si adattano tra le lingue. Per le aziende che servono utenti in diverse regioni, questa copertura — e la capacità di cambiare lingua senza artefatti visivi — riguarda direttamente le interazioni con i clienti a livello globale.
Avatar personalizzabili
Le organizzazioni possono scegliere tra una libreria di avatar predefiniti con apparenze, voci e stili espressivi diversi. Possono anche personalizzare i Live Avatar per riflettere un marchio o un'identità di personaggio.
Utilizzando un'immagine di riferimento di alta qualità, gli sviluppatori possono generare un avatar completamente animato e reattivo, preservando la somiglianza del riferimento, lo stile del marchio o l'identità del personaggio. Google DeepMind ha dichiarato che la creazione di avatar personalizzati è attualmente disponibile solo tramite allowlisting aziendale, lasciando la libreria predefinita come opzione per le organizzazioni fuori da tale elenco.
Watermarking e sicurezza
Google DeepMind ha dichiarato che Live Avatar include misure di salvaguardia concepite per rispettare l'identità e mantenere trasparente il contenuto generato dall'AI. L'output generato dai suoi prodotti AI è contrassegnato con SynthID, un watermark impercettibile incorporato direttamente in audio e video.
L'azienda ha affermato che il watermark aiuta a mantenere rilevabile il contenuto generato dall'AI ed è destinato a contribuire a ridurre la disinformazione e le attribuzioni errate. Per le imprese che mettono personaggi video espressivi davanti ai clienti, il watermark è ciò che consente di identificare come sintetiche le interazioni generate dall'AI. Ulteriori informazioni sull'approccio dell'azienda sicurezza e deployment responsabile sono disponibili nella sua model card.
Gemini 3.8 Live con Live Avatar è disponibile in Gemini Enterprise. Google DeepMind ha inoltre indirizzato gli sviluppatori alla sua documentazione API per iniziare. Per i team che desiderano avatar specifici del marchio oltre alla libreria predefinita, l'allowlist aziendale per la creazione di avatar personalizzati è l'elemento di accesso da monitorare.