NotizieAzioniGoogle DeepMind lancia Gemini 3.8 Flash TTS e Flash-Lite TTS, i suoi modelli text-to-speech più espressivi fino ad oggi

Google DeepMind lancia Gemini 3.8 Flash TTS e Flash-Lite TTS, i suoi modelli text-to-speech più espressivi fino ad oggi

Autore: Google DeepMind Blog·

Punti chiave

  • Google DeepMind ha lanciato due modelli text-to-speech: Gemini 3.8 Flash TTS, pensato per il design espressivo dei personaggi e la regia di scene, e Gemini 3.8 Flash-Lite TTS, pensato per una generazione vocale su larga scala ed economicamente efficiente.
  • Gli utenti possono progettare voci originali tramite prompt in linguaggio naturale, scegliere tra una libreria di oltre 2.000 voci pronte per la produzione in più di 100 lingue e dialetti e replicare una voce da un campione audio di 30 secondi.
  • Entrambi i modelli offrono controllo riga per riga su ritmo, emozione, segnali non verbali e regia di scene a due parlanti, e possono generare ore di audio continuo con una deriva minima del parlante.
  • Google riferisce che Gemini 3.8 Flash TTS si è classificato primo nel Voice Design Benchmark di Hume AI con un punteggio di 71.4, e che i due modelli hanno occupato le prime due posizioni nell'Overall Quality Index di Hume AI.
  • La replica vocale richiede il consenso verificato del proprietario della voce, tutto l'audio generato è protetto da filigrana SynthID e la replica tramite AI Studio non è disponibile in regioni tra cui Illinois, Texas, SEE, Regno Unito, Svizzera e India.
Google DeepMind lancia Gemini 3.8 Flash TTS e Flash-Lite TTS, i suoi modelli text-to-speech più espressivi fino ad oggi

Google DeepMind ha annunciato il 23 settembre 2026 il rilascio di 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, due modelli text-to-speech che l'azienda descrive come i suoi modelli di generazione audio più espressivi fino ad oggi. I modelli generano voci di personaggi personalizzate e dialoghi di scena interamente diretti, e vengono distribuiti su Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook e Google Vids. Il text-to-speech è diventato un settore in rapida sviluppo dell'AI generativa, con la produzione di audiolibri, il gaming, il doppiaggio e i voice agent in tempo reale a guidare la domanda di voce sintetica dal suono convincentemente umano.

L'annuncio, pubblicato sul blog di Google DeepMind, è stato firmato da Leland Rechis, Group Product Manager, e Alan Cowen, Direttore della Ricerca Scientifica, a nome del Gemini Audio Team.

Nel suo riassunto, Google indica che gli utenti possono creare voci personalizzate da zero o replicarne di esistenti con semplici prompt in linguaggio naturale, dirigere l'audio riga per riga per controllare ritmo, emozione e persino suoni conversazionali realistici, e utilizzare i modelli per audiolibri, podcast o voice agent in tempo reale di alta qualità su larga scala. Sono inclusi strumenti di sicurezza integrati, tra cui la filigrana, per contribuire a mantenere sicuro l'audio generato.

Due modelli per carichi di lavoro diversi

Google presenta il lancio come una trasformazione della generazione vocale "da preset statici a uno studio creativo dinamico", che consente a creatori, sviluppatori e aziende di realizzare esperienze audio più ricche ed espressive. L'azienda aggiunge che i modelli migliorano anche l'esperienza utente nei suoi stessi prodotti, tra cui Gemini Notebook e Google Vids.

Gemini 3.8 Flash TTS è pensato per la regia creativa avanzata e il design dei personaggi. Può creare voci completamente nuove zero utilizzando prompt in linguaggio naturale per dare vita ai personaggi nel gaming, negli audiolibri immersivi, nei podcast e nei media interattivi. Gli utenti possono dirigere ogni performance riga per riga, con controllo granulare su indicazioni recitative, ritmo, cambi di dialetto e backchanneling.

Gemini 3.8 Flash-Lite TTS è pensato per un'elaborazione su larga scala ed economicamente efficiente. Google indica che è ottimizzato per il doppiaggio ad alto volume, la creazione di contenuti audio e voice agent espressivi, con controllo fine su tono, ritmo e sfumature espressive. La divisione tra Flash e Flash-Lite segue la convenzione di denominazione che Google utilizza già nell'intera famiglia Gemini, dove le varianti Lite rappresentano opzioni più leggere e orientate al costo per carichi di lavoro ad alto throughput.

I due modelli completano una famiglia Gemini Audio in rapida crescita che in precedenza comprendeva 3.5 Live Translate, 3.5 Transcribe, 3.8 Live e 3.8 Live Extended Thinking.

Creare e personalizzare le proprie voci

Con i nuovi modelli, Google passa da 30 voci originali a quella che definisce una libreria infinita. Che l'obiettivo sia una voce di personaggio completamente originale o un portavoce coerente del brand, l'azienda afferma che Gemini 3.8 Flash TTS funge da studio vocale completo, consentendo agli utenti di creare e utilizzare voci espressive dal suono naturale per ogni occasione, mentre sviluppatori e aziende costruiscono sopra di esse esperienze audio personalizzate.

Le funzionalità di creazione vocale annunciate oggi includono:

Generative voice design. Con Gemini 3.8 Flash TTS, gli utenti possono creare voci su misura da zero personalizzando ruolo, accento e caratteristiche vocali in più di 100 lingue e dialetti tramite prompt in linguaggio naturale — che si tratti, negli esempi di Google, di dare vita a un drammatico dragone sputafuoco o di creare un narratore carismatico con una cadenza regionale distintiva. Le clip dimostrative rilasciate insieme al post mostrano il modello che genera una voce da DJ ad alta energia di Melbourne, una voce robotica monocorde estremamente metallica e un dragone giapponese.

Libreria vocale ampia. La piattaforma offre oltre 2.000 voci pronte per la produzione con un'ampia copertura linguistica, incluse varietà regionali come lo spagnolo messicano, il francese del Québec e l'inglese scozzese.

Replica vocale. Gli utenti possono ricreare profili vocali coerenti a partire da un campione audio di 30 secondi della propria voce, o di una voce i cui diritti di utilizzo possiedono. La funzionalità è supportata da verifica del consenso integrata, filigrana SynthID e credenziali C2PA — uno standard industriale aperto per registrare la provenienza di un contenuto e come è stato prodotto — per proteggere sia gli sviluppatori sia i loro talenti vocal.

Salvataggio e scalabilità. Le voci personalizzate possono essere salvate e gestite per garantire prestazioni coerenti e una deriva minima nei progetti in corso.

Remix vocale. Prossimamente, gli utenti potranno scegliere una voce dalla libreria e regolarne timbro, tono, ritmo e accento, usando prompt per calibrare caratteristiche come "aggiungi un leggero accento del Sud degli Stati Uniti" o "ammorbidisci l'interpretazione".

Dirigere la performance, riga per riga

Dopo aver selezionato le voci, entrambi i modelli TTS offrono agli utenti un controllo preciso su come ogni riga viene interpretata. Gli utenti possono scrivere le proprie didascalie sceniche o lasciare che Gemini guidi l'interpretazione con indicazioni testuali naturali — da un operatore clienti tranquillo a una scena di suspense sussurrata. Le dimostrazioni di Google mostrano il modello che alimenta conversazioni naturali ed estremamente espressive per voice agent interattivi, oltre al controllo granulare dello script usato per costruire esperienze audio immersive e coinvolgenti e scene di dialogo interamente recitate con turni di parola naturali.

Le altre capacità di performance includono:

Generazione long-form. I modelli mantengono un'elevata qualità vocale, un ritmo naturale e il timbro dei personaggi su ore di audio continuo con una deriva minima del parlante, soluzione che Google considera ideale per podcast e audiolibri.

Regia nativa di scene a due parlanti. Le conversazioni a più turni possono essere dirette senza soluzione di continuità da un unico script — sia per un podcast sia per una narrazione drammatica — mantenendo le due voci nettamente distinte con turni di parola conversazionali naturali.

Interiezioni vocali scriptate e backchanneling. Segnali non verbali come <laughs>, <sigh> e <gasp>, insieme a interiezioni di ascolto attivo come |mhm| o |yeah|, aggiungono una texture conversazionale realistica per un timing comico e battute di reazione precise.

Benchmark e copertura multilingue

Google riferisce che Gemini 3.8 Flash TTS offre capacità di personalizzazione vocale all'avanguardia, assicurandosi il primo posto complessivo nel Voice Design Benchmark di Hume AI, una valutazione indipendente dell'azienda di ricerca AI specializzata nella voce Hume AI, con un punteggio di 71.4, e guidando anche la modellazione degli accenti con 60.8. L'azienda aggiunge che Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS consentono performance espressive senza sacrificare l'affidabilità, conquistando rispettivamente il primo e il secondo posto nell'Overall Quality Index di Hume AI.

Rispetto a Gemini 3.1 Flash TTS, Google indica che il nuovo modello mostra miglioramenti significativi in un'ampia gamma di casi d'uso, inclusi i contenuti long-form e il controllo di sceneggature a due parlanti.

Nelle valutazioni alla cieca delle preferenze umane su Voice Arena, in cui gli ascoltatori confrontano campioni anonimizzati senza sapere quale modello li ha prodotti, Gemini 3.8 Flash e Flash-Lite TTS hanno ottenuto posizioni di vertice tra i concorrenti in lingue globali chiave, tra cui giapponese, portoghese brasiliano, vietnamita, arabo standard moderno (MSA), spagnolo messicano e hindi. Con il supporto per più di 100 lingue, l'azienda afferma che i modelli consentono a creatori, sviluppatori e aziende di costruire esperienze vocali multilingue di alta qualità in tutto il mondo.

Sicurezza, consenso e trasparenza

Google dichiara di aver sviluppato le funzionalità di creazione e replica vocale con righe tutele per aiutare a proteggere i talenti vocali, rispettare l'identità e garantire la trasparenza dei contenuti. Per la replica vocale, il sistema si avvale della verifica del consenso: gli utenti devono fornire una registrazione vocale di consenso del proprietario della voce corrispondente al parlante di riferimento prima che una voce possa essere creata. Queste tutele riguardano uno dei rischi più osservati nell'audio generativo: l'uso improprio di voci clonate per impersonazione e frodi, che ha reso i flussi di consenso e verifica un punto focale dei dibattiti sulle politiche dell'AI.

Più in generale, ogni clip audio generata dai modelli Gemini Audio è protetta da filigrana SynthID, la tecnologia di watermarking di DeepMind per identificare i contenuti generati dall'AI. Google descrive la filigrana come impercettibile e intrecciata direttamente nell'output audio, mantenendo la voce generata dall'AI rilevabile per contribuire a prevenire la disinformazione. Ulteriori dettagli sull'approccio dell'azienda a sicurezza e responsabilità sono disponibili nella model card audio di Gemini 3.8.

Google segnala anche una restrizione regionale: la replica vocale tramite AI Studio non è disponibile in Illinois, Texas, Spazio economico europeo (SEE), Regno Unito, Svizzera e India.

Uno spazio di voice design in Google AI Studio

A partire da oggi, gli sviluppatori possono provare le nuove capacità di generazione vocale in Google AI Studio. Progettato come uno spazio di voice design, lo strumento permette di generare da zero identità vocali completamente nuove o di replicare la propria voce, per poi portarle direttamente in un editor di sceneggature a due parlanti per dirigere l'interpretazione riga per riga.

Piattaforme per sviluppatori e partner di lancio

Tramite la Gemini API, piattaforme per sviluppatori come Agora, LiveKit, Pipecat e Vercel — un gruppo che comprende infrastrutture di comunicazione in tempo reale, framework per voice agent e strumenti di deployment — permettono agli sviluppatori di costruire e distribuire con facilità esperienze di generazione vocale ad alte prestazioni.

Google collabora inoltre con aziende come Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang, che integrano i più recenti modelli TTS per accelerare il doppiaggio globale, localizzare i media con accenti regionali sfumati e alimentare voice agent conversazionali su larga scala.

Disponibilità

Entrambi i modelli sono in distribuzione a partire da oggi.

ini 3.8 Flash TTS:

  • Per gli sviluppatori: disponibile nella Gemini API e in Google AI Studio.
  • Per le aziende: in arrivo tramite API in Gemini Enterprise.
  • Per tutti: disponibile in Gemini Notebook.

Gemini 3.8 Flash-Lite TTS:

  • Per gli sviluppatori: disponibile nella Gemini API e in Google AI Studio.
  • Per le aziende: in arrivo tramite API in Gemini Enterprise.
  • Per tutti: disponibile in Google Vids.

Le funzionalità contrassegnate da Google come in arrivo — il remix vocale e l'accesso tramite API a Gemini Enterprise — rappresentano le prossime tappe da seguire man mano che la distribuzione si estende oltre i partner di lancio odierni e i punti di accesso anticipato.

Con il rilascio, la gamma Gemini Audio copre traduzione e trascrizione in tempo reale, conversazione vocale in tempo reale tramite 3.8 Live e 3.8 Live Extended Thinking e, ora, la generazione vocale espressiva, offrendo a creatori, sviluppatori e aziende un'unica famiglia di modelli per costruire prodotti guidati dalla voce.