NotizieAzioniGoogle lancia i modelli audio Gemini 3.8 Live per l'AI conversazionale in tempo reale

Google lancia i modelli audio Gemini 3.8 Live per l'AI conversazionale in tempo reale

Autore: AI Business·

Punti chiave

  • Google ha rilasciato il 15 settembre Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, modelli audio pensati per creare agenti vocali capaci di ragionare ed eseguire attività durante conversazioni in diretta.
  • I modelli possono effettuare chiamate API e agli strumenti durante lo streaming delle risposte audio, accettare input visivi in diretta e supportare oltre 97 lingue.
  • La versione Extended Thinking include il thinking configurabile, una funzionalità che consente agli utenti di attivare o disattivare il ragionamento interno del modello.
  • L'architettura separa la latenza interattiva dalla latenza di ragionamento, permettendo agli agenti di mantenere la conversazione mentre il ragionamento prosegue in background invece di metterla in pausa in attesa di una risposta.
  • Gli analisti ritengono che Google stia recuperando terreno rispetto a fornitori come Apple avanzando nell'interazione AI in tempo reale, con applicazioni aziendali che includono chatbot per l'assistenza clienti, processi di vendita e applicazioni agentiche multimodali.
Google lancia i modelli audio Gemini 3.8 Live per l'AI conversazionale in tempo reale

Google ha presentato due nuovi modelli audio che consentono alle aziende di implementare agenti AI intelligenti con un ragionamento più profondo, maggiore interattività e velocità conversazionale.

Lanciati il 15 settembre, Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking permettono agli sviluppatori di creare agenti vocali capaci di ragionare ed eseguire attività mantenendo il fluido della conversazione, ha dichiarato Google. I modelli supportano l'interazione in tempo reale senza la tradizionale struttura prompt-risposta, consentendo agli utenti di conversare naturalmente invece di formulare prompt discreti.

Le capacità principali dei modelli includono l'esecuzione di chiamate API e agli strumenti — i meccanismi con cui gli agenti si collegano a sistemi esterni ed eseguono attività — mentre continuano a trasmettere risposte audio agli utenti, l'accettazione di input visivi in diretta che aiutano gli agenti a capire sia ciò che gli utenti dicono sia ciò che vedono, e il supporto per oltre 97 lingue, una gamma rilevante per le aziende che distribuiscono agenti vocali su più regioni. La versione Extended Thinking aggiunge il thinking configurabile, una funzionalità che consente agli utenti di attivare o disattivare il ragionamento interno di un modello AI.

Il lancio arriva due settimane dopo l'introduzione iniziale da parte di Google dei modelli fondativi Gemini 3.8 Flash e 3.8 Cyber.

Con le capacità di 3.8 Live, Google sembra stare recuperando terreno rispetto a fornitori come Apple, che offre già la trascrizione in tempo reale in app di produttività come Note e Memo vocali, ha detto Bradley Shimmin, analista di Futurum Group. Tuttavia, la tecnologia di Google porta tutto a un livello successivo cambiando il modo in cui gli utenti interagiscono con l'AI, ha aggiunto.

Conversazioni reali

"Dal modo in cui è progettato… puoi personalizzarlo per comportarsi in molti modi diversi," ha detto Shimmin. Ha notato che, mentre le aziende possono usare i modelli per casi d'uso tradizionali di traduzione, Google li ha anche progettati in modo che gli utenti non interagiscano secondo lo schema prompt-risposta; possono invece avere una vera conversazione.

"È semplicemente una conversazione naturale con la possibilità di interromperla in tempo reale per inserire qualcosa," ha detto Shimmin. "Puoi iniettare contesto nella conversazione senza interrompere ciò che sta facendo."

Con la tecnologia avanzata di riconoscimento vocale di Google, i nuovi modelli non si limitano a rispondere a una domanda alla lettera, ha detto Sid Nag, fondatore di Tekonyx.

"Il modello è progettato per eseguire ragionamento in background," ha detto Nag. "Lo fa durante la conversazione, così puoi mantenere viva la conversazione mentre sta ragionando."

Questa tecnologia rappresenta un avanzamento in cui la latenza interattiva — il ritardo tra l'azione dell'utente e la risposta del sistema — è separata dalla latenza di ragionamento, ovvero il tempo totale necessario a un modello AI per elaborare le informazioni. È proprio questa separazione a permettere a un agente di mantenere viva la conversazione mentre ragionamento prosegue in background, invece di sospendere l'interazione fino a quando la risposta non è pronta.

"Lo fa in tempo reale, invece di bloccarsi e poi tornare con un'altra risposta," ha detto Nag.

I modelli vocali cambiano inoltre il modo in cui un agente AI risponde e interagisce, perché "un agente AI non deve necessariamente scegliere tra essere veloce ed essere riflessivo," ha proseguito Nag. "Può effettivamente mantenere un'interazione in tempo reale."

Le applicazioni aziendali per i nuovi modelli includono chatbot per l'assistenza clienti, processi di vendita e applicazioni agentiche multimodali che combinano testo, voce e video, ha detto Nag. Le applicazioni agentiche sono software in cui gli agenti AI ragionano ed eseguono attività invece di limitarsi a rispondere ai prompt — uno schema che si basa sulle chiamate agli strumenti nel mezzo della conversazione e sul ragionamento in background del tipo offerto dai nuovi modelli.

Servizio di Esther Shittu, AI Business. Servizio originale: Gemini 3.8 Live Transforms Conversational AI, pubblicato il 17 settembre 2026.