Google DeepMind lancia Gemini 3.8 Live e 3.8 Live Extended Thinking per una voce AI naturale
Punti chiave
- •Google DeepMind ha lanciato Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking il 15 settembre 2026, descrivendoli come i suoi più avanzati modelli di dialogo in tempo reale fino ad oggi.
- •Gemini 3.8 Live Extended Thinking si è classificato primo nella Speech Speech Quality Index di Artificial Analysis, con il 68,6% nel benchmark agentico τ-Voice e il 97,7% su Big Bench Audio.
- •I modelli elaborano input visivi quasi in tempo reale, passano automaticamente tra 97 lingue supportate durante la conversazione ed eseguono strumenti e chiamate API in background mentre la conversazione continua.
- •Gemini 3.8 Live è posizionato per scalabilità ed efficienza dei costi, mentre Extended Thinking è progettato per compiti ad alta complessità con ragionamento e parlato simultanei, inclusa la narrazione dei progressi in tempo reale.
- •Entrambi i modelli sono disponibili da oggi tramite la Gemini API e Google AI Studio, con distribuzioni per aziende e consumatori su Gemini Enterprise, Google Workspace, Search Live e l'app Gemini.

Google DeepMind ha annunciato il 15 settembre 2026 il lancio di Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, che l'azienda descrive come i suoi più avanzati modelli di dialogo in tempo reale fino ad oggi. Secondo l'annuncio, i due modelli portano progressi nel ragionamento quasi in tempo reale per abilitare in modo più efficace gli agenti vocali, con importanti aggiornamenti di intelligenza e ragionamento parallelo che li rendono più intuitivi da usare in collaborazione e più adatti all'esecuzione di compiti complessi tramite la voce.
Il post è stato redatto da Tom Ouyang, Principal Engineer, e Malini Jaganathan, Member of Technical Staff, a nome del Gemini Audio Team.
Google ha dichiarato che il lancio è pensato per rendere le interazioni vocali più naturali, fluide e intelligenti. I nuovi modelli gestiscono ragionamento complesso, contesto visivo in tempo reale ed esecuzione di attività in background senza interrompere la conversazione in corso. Possono gestire interruzioni, passare da una lingua all'altra e spiegare il loro processo di pensiero mentre lavorano — un comportamento che Google descrive come un passo avanti verso un'AI che assomiglia a un vero interlocutore. Che gli utenti stiano risolvendo un problema complesso o semplicemente chiacchierando, l'azienda afferma che l'esperienza è progettata per dare la sensazione che l'AI stia ascoltando e ragionando insieme a loro. Le funzionalità sono disponibili da oggi tramite la Gemini API, Google Workspace e l'app Gemini.
I due modelli si rivolgono a casi d'uso distinti:
- Gemini 3.8 Live è costruito per scalabilità ed efficienza dei costi, combinando intelligenza conversazionale con dialogo fluido e grounding visivo.
- Gemini 3.8 Live Extended Thinking è costruito per compiti ad alta complessità, con maggiore intelligenza e ragionamento multi-step.
Per sviluppatori e aziende, Google presenta i modelli come mattoni fondamentali per agenti vocali affidabili e pronti per la produzione. L'azienda aggiunge che rendono la conversazione con Gemini su app Gemini, Google Workspace e Search più fluida collaborativa, aiutando gli utenti ad affrontare compiti complessi usando solo la voce.
Benchmark e prestazioni
Gemini 3.8 Live Extended Thinking offre ciò che Google descrive come completamento di attività di livello enterprise e intelligenza, conquistando il primo posto complessivo nella Speech to Speech Quality Index di Artificial Analysis con un punteggio di 82,6. Il modello guida nel completamento di compiti agentici, con il 68,6% su τ-Voice e il 35,1% sul benchmark τ-Voice-banking di Sierra. Offre inoltre solide capacità di ragionamento, con un punteggio del 97,7% su Big Bench Audio, mantenendo un prezzo altamente competitivo rispetto ad altri modelli all'avanguardia.
Gemini 3.8 Live ha mostrato una forte preferenza tra gli utenti, ottenendo il secondo posto nella Speech Agent Arena. Oltre a questo risultato, Google sottolinea che resta altamente conveniente in termini di costi, offrendo a sviluppatori e aziende un modello capace ed efficiente, pensato per la scala.
Sull'EVA-Bench di ServiceNow, un benchmark per la valutazione degli agenti vocali, Google ha dichiarato che i suoi modelli spingono la Pareto Frontier per i flussi di lavoro complessi bilanciando con successo accuratezza e qualità conversazionale. L'azienda precisa che la valutazione è stata eseguita sulla Live API sulla Gemini Enterprise Agent Platform.
Contesto visivo, 97 lingue ed esecuzione in background
Gemini 3.8 Live elabora input visivi quasi in tempo reale, arricchendo le conversazioni con contesto per risposte più utili. Rileva automaticamente e passa tra le 97 lingue supportate durante la conversazione. Il modello esegue anche strumenti e chiamate API in background mentre la conversazione continua, consentendo di confermare le richieste e continuare a chattare mentre le attività si completano dietro le quinte.
Le dimostrazioni video pubblicate con l'annuncio mostrano il modello che guida l'onboarding dei dipendenti in tempo reale, usa il contesto visivo per rispondere a domande in diretta e gioca a scacchi quasi in tempo reale combinando contesto visivo, ragionamento e flusso conversazionale naturale.
Ragionare e parlare contemporaneamente
Per i compiti che richiedono un ragionamento più profondo, Gemini 3.8 Live Extended Thinking ragiona e parla allo stesso tempo. Google afferma che il modello offre maggiore intelligenza per flussi di lavoro complessi mantenendo un flusso conversazionale ininterrotto. Usa segnali verbali anticipati, come "Fammi verificare…", per confermare le richieste in modo naturale, e fornisce una narrazione in tempo reale dei progressi per accompagnare gli utenti attraverso attività multi-step in background mentre procedono.
Le dimostrazioni includono Gemini 3.8 Live Extended Thinking che trasforma schizzi grezzi e feedback vocali quasi in tempo reale in componenti React funzionanti, e coordina prenotazioni multi-step e chiamate funzioni asincrone senza interrompere la conversazione naturale. Google ha inoltre mostrato Gemini 3.8 Live creare piani aziendali completi e toolkit di marketing personalizzati al volo tramite linguaggio naturale.
Integrazione con Google Workspace e Search
Su Google Workspace e Search, i modelli Live sono progettati per offrire esperienze più intuitive e collaborative, in particolare nell'affrontare i compiti più complessi. Gemini 3.8 Live Extended Thinking può essere usato in Google Workspace tramite Docs Live, Gmail Live e Keep Live. Search Live offre assistenza passo-passo per la risoluzione dei problemi in tempo reale basata su Gemini 3.8 Live.
Ecosistema vocale per sviluppatori e aziende
Utilizzando la Gemini Live API, piattaforme per sviluppatori come Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents consentono agli sviluppatori di creare e distribuire con facilità interfacce vocali ad alte prestazioni. Queste piattaforme gestiscono dietro le quinte una complessa infrastruttura di streaming multimediale in tempo reale, permettendo agli sviluppatori di concentrarsi interamente sulla realizzazione dell'esperienza utente.
Google ha aggiunto di collaborare con aziende come Salesforce, Genspark e Lumeris, entusiaste di 3.8 Live e 3.8 Live Extended Thinking, evidenziandone la latenza, la fluidità e le capacità di chiamata degli strumenti.
Trasparenza con la filigrana SynthID
Tutto l'audio generato dai prodotti AI di Google è contrassegnato con SynthID. L'azienda spiega che questa filigrana impercettibile è intrecciata direttamente nell'output audio, garantendo che i contenuti generati dall'AI restino rilevabili per aiutare a prevenire la disinformazione. Per i dettagli sull'approccio alla sicurezza e alla responsabilità, Google rimanda gli lettori alla model card.
Come iniziare a usare i più recenti modelli audio Gemini:
Entrambi i modelli sono in distribuzione da oggi, su superfici per sviluppatori, aziende e consumatori.
Gemini 3.8 Live:
- Per gli sviluppatori: nella Gemini API e in Google AI Studio.
- Per le aziende: in anteprima privata in Gemini Enterprise, e presto in Gemini Enterprise for Customer Experience.
- Per tutti: in Search Live.
Gemini 3.8 Live Extended Thinking:
- Per gli sviluppatori: nella Gemini API e in Google AI Studio.
- Per le aziende: in anteprima privata in Gemini Enterprise, e presto in Gemini Enterprise for Customer Experience e per i clienti aziendali di Google Workspace.
- Per tutti: in Gemini Live, per gli abbonati Google AI Pro e Ultra in Workspace in Docs, e per tutti gli abbonati Google AI in Gmail e Keep.
L'annuncio completo, incluse le dimostrazioni video, è disponibile sul blog di Google DeepMind.