Google DeepMind lanceert Gemini 3.8 Flash TTS en Flash-Lite TTS, de meest expressieve tekst-naar-spraakmodellen tot nu toe
Belangrijkste punten
- •Google DeepMind lanceerde twee tekst-naar-spraakmodellen: Gemini 3.8 Flash TTS, gebouwd voor expressief karakterontwerp en scèneregie, en Gemini 3.8 Flash-Lite TTS, gebouwd voor grootschalige, kostenefficiënte spraakgeneratie.
- •Gebruikers kunnen originele stemmen ontwerpen via natuurlijke-taalprompts, kiezen uit een bibliotheek met meer dan 2.000 productieklare stemmen in meer dan 100 talen en dialecten, en een stem repliceren op basis van een audiosample van 30 seconden.
- •Beide modellen bieden regel-voor-regel-controle over tempo, emotie, non-verbale signalen en scèneregie met twee sprekers, en kunnen uren continue audio genereren met minimale sprekersdrift.
- •Google meldt dat Gemini 3.8 Flash TTS eerste werd op Hume AI's Voice Design Benchmark met een score van 71.4, en dat de twee modellen de top twee posities innamen op Hume AI's Overall Quality Index.
- •Stemreplicatie vereist geverifieerde toestemming van de stembezitter, alle gegenereerde audio is voorzien van SynthID-watermerken, en replicatie via AI Studio is niet beschikbaar in regio's waaronder Illinois, Texas, de EER, het Verenigd Koninkrijk, Zwitserland en India.

Google DeepMind kondigde op 23 september 2026 de release aan van 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS, twee tekst-naar-spraakmodellen die het bedrijf beschrijft als zijn meest expressieve audio-generatiemodellen tot nu toe. De modellen genereren aangepaste karakterstemmen en volledig geregisseerde dialoog op scèneniveau, en worden uitgerold via Google AI Studio, de Gemini API, Gemini Enterprise, Gemini Notebook en Google Vids. Tekst-naar-spraak is een snel ontwikkelend terrein binnen generatieve AI geworden, waar productie van luisterboeken, gaming, nasynchronisatie en realtime spraakagenten de vraag naar synthetische spraak die overtuigend menselijk klinkt aanjagen.
De aankondiging, gepubliceerd op de Google DeepMind-blog, is geschreven door Leland Rechis, Group Product Manager, en Alan Cowen, Director of Research Science, namens het Gemini Audio-team.
In de samenvatting zegt Google dat gebruikers aangepaste stemmen vanaf nul kunnen creëren of bestaande kunnen repliceren met eenvoudige natuurlijke-taalprompts, hun audio regel voor regel kunnen regisseren om tempo, emotie en zelfs realistische conversationele geluiden te sturen, en de modellen kunnen inzetten voor hoogwaardige luisterboeken, podcasts of realtime spraakagenten op schaal. Ingebouwde veiligheidstools, waaronder watermerken, zijn toegevoegd om gegenereerde audio te beveiligen.
Twee modellen voor verschillende workloads
Google presenteert de lancering als een transformatie van spraakgeneratie "van statische presets naar een dynamische creatieve studio", waarmee makers, ontwikkelaars en bedrijven rijkere, expressievere audio-ervaringen kunnen bouwen. Het bedrijf voegt eraan toe dat de modellen ook verbeterde gebruikerservaringen mogelijk maken in eigen producten, waaronder Gemini Notebook en Googleids.
Gemini 3.8 Flash TTS is gebouwd voor diepgaande creatieve regie en karakterontwerp. Het kan volledig nieuwe stemmen vanaf nul creëren met natuurlijke-taalprompts om karakters tot leven te wekken in gaming, meeslepende luisterboeken, podcasts en interactieve media. Gebruikers kunnen elke uitvoering regel voor regel regisseren, met fijnmazige controle over acteeracadances, tempo, dialectwisselingen en backchanneling.
Gemini 3.8 Flash-Lite TTS is gebouwd voor grootschalige, kostenefficiënte schaalbaarheid. Google zegt dat het is geoptimaliseerd voor nasynchronisatie in grote volumes, audiocreatie en expressieve spraakagenten, met fijnmazige controle over toon, tempo en expressieve nuance. De Flash- en Flash-Lite-splitsing volgt de naamconventie die Google al gebruikt binnen de Gemini-familie, waarbij Lite-varianten lichtere, op kosten gerichte opties zijn voor workloads met een hoge doorvoer.
De twee modellen vullen een snel groeiende Gemini Audio-familie aan die eerder 3.5 Live Translate, 3.5 Transcribe, 3.8 Live en 3.8 Live Extended Thinking omvatte.
Creëer en pas je eigen stemmen aan
Met de nieuwe modellen schaalt Google op van 30 originele stemmen naar wat het een oneindige bibliotheek noemt. Of het doel nu een volledig originele karakterstem of een consistente merkambassadeur is, het bedrijf zegt dat Gemini 3.8 Flash TTS een complete vocale studio aandrijft, waarmee gebruikers expressieve, natuurlijk klinkende stemmen kunnen creëren en inzetten voor elk moment, terwijl ontwikkelaars en bedrijven er aangepaste audio-ervaringen op bouwen.
De vandaag aangekondigde functies voor spraakcreatie omvatten:
Generatief stemontwerp. Gebruikers kunnen met Gemini 3.8 Flash TTS op maat gemaakte stemmen vanaf nul creëren door rol, accent en stemkenmerken aan te passen in meer dan 100 talen en dialecten via natuurlijke-taalprompts — of het nu gaat om het tot leven wekken van een dramatische, vuurspuwende draak of het ontwerpen van een charismatische verteller met een uitgesproken regionaal ritme, zoals in Googles voorbeelden. Democlips die samen met de post zijn uitgebracht, laten het model een energieke dj-stem uit Melbourne genereren, een superdunne, monotone robotstem en een Japanse draak.
Uitgebreide stembibliotheek. Het platform biedt meer dan 2.000 productieklare stemmen met brede taaldekking, waaronder regionale varianten zoals Mexicaans-Spaans, Quebecs-Frans en Schots-Engels.
Stemreplicatie. Gebruikers kunnen consistente stemprofielen reconstrueren op basis van een audiosample van 30 seconden van hun eigen stem of van een stem waarop ze gebruiksrechten hebben. De functie wordt ondersteund door ingebouwde toestemmingsverificatie, SynthID-watermerken en C2PA-credentials — een open industriestandaard voor het vastleggen waar een mediabestand vandaan komt en hoe het is geproduceerd — om zowel ontwikkelaars als hun spreekent te beschermen.
Opslaan en schalen. Aangepaste stemmen kunnen worden opgeslagen en beheerd om consistente prestaties en minimale drift binnen lopende projecten te waarborgen.
Stemremixing. Binnenkort kunnen gebruikers een stem uit de bibliotheek kiezen en het timbre, de toonhoogte, het tempo en het accent verfijnen, met prompts om kenmerken bij te stellen zoals "voeg subtiel zuidelijk Amerikaans accent toe" of "verzacht de overdracht".
Regisseer de uitvoering, regel voor regel
Nadat stemmen zijn geselecteerd, geven beide TTS-modellen gebruikers nauwkeurige controle over hoe elke regel wordt gebracht. Gebruikers kunnen hun eigen regieaanwijzingen schrijven of Gemini de levering laten sturen met natuurlijke scriptaanwijzingen — van een rustige klantenservicemedewerker tot een gefluisterde suspense-scène. Googles demo's laten zien dat het model natuurlijke, zeer expressieve gesprekken aandrijft voor interactieve spraakagenten, evenals fijnmazige scriptregie voor diep meeslepende, meeslepende audio-ervaringen en volledig uitgevoerde dialogcènes met natuurlijke beurtwisseling.
Andere uitvoeringsmogelijkheden zijn onder meer:
Lange-vormgeneratie. De modellen behouden hoge stemkwaliteit, natuurlijk tempo en karaktertimbre over uren continue audio met minimale sprekersdrift, wat Google neerzet als ideaal voor podcasts en luisterboeken.
Nationale twee-sprekers-scèneregie. Meerdere gespreksbeurten kunnen naadloos vanuit één script worden geregisseerd — of nu voor een podcast of dramatische vertelling — terwijl beide stemmen duidelijk gescheiden blijven met natuurlijke conversationele beurtwisseling.
Gescripteerde vocale uitspruiten en backchanneling. Non-verbale signalen zoals <laughs>, <sigh> en <gasp>, samen met actief-luisterende tussenwerpsels zoals |mhm| of |yeah|, voegen realistische conversationele textuur toe voor precieze komische timing en reactiemomenten.
Benchmarks en meertalig bereik
Google meldt dat Gemini 3.8 Flash TTS toonaangevende mogelijkheden voor stemaanpassing levert, met de eerste plaats overall op Hume AI's Voice Design Benchmark, een onafhankelijke evaluatie van het op spraak gerichte AI-onderzoeksbedrijf Hume AI, met een score van 71.4, en ook leidt in accentmodellering met 60.8. Het bedrijf voegt eraan toe dat Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS expressieve uitvoeringen mogelijk maken zonder betrouwbaarheid op te offeren, met respectievelijk de eerste en tweede plaats op Hume AI's Overall Quality Index.
Vergeleken Gemini 3.1 Flash TTS laat het nieuwe model volgens Google grote verbeteringen zien in een breed scala aan gebruikssituaties, waaronder lange-vormcontent en regie van scripts met twee sprekers.
In blinde menselijke voorkeursevaluaties op Voice Arena, waar luisteraars geanonimiseerde samples vergelijken zonder te weten welk model ze produceerde, behaalden Gemini 3.8 Flash en Flash-Lite TTS topposities onder concurrenten in belangrijke wereldtalen, waaronder Japans, Braziliaans-Portugees, Vietnamees, Modern Standaardarabisch (MSA), Mexicaans-Spaans en Hindi. Met ondersteuning voor meer dan 100 talen zeggen de modellen makers, ontwikkelaars en bedrijven in staat te stellen hoogwaardige, meertalige spraakervaringen wereldwijd te bouwen.
Veiligheid, toestemming en transparantie
Google zegt dat het de functies voor spraakcreatie en -replicatie heeft gebouwd met strenge beveiligingsmaatregelen om spreektalent te beschermen, identiteit te respecteren en transparantie van content te waarborgen. Voor stemreplicatie gebruikt het systeem toestemmingsverificatie: gebruikers moeten een verbale toestemmingsopname van de stembezitter overleggen die overeenkomt met de referentiespreker voordat een stem kan worden aangemaakt. Deze beveiligingsmaatregelen spreken een van de meest gevolgde risico's in generatieve audio aan: het misbruik van gekloonde stemmen voor imitatie en fraude, wat toestemmings- en verificatieworkflows tot een focuspunt van AI-beleidsdebatten heeft gemaakt.
Breder gezegd is elke audioclip die door de Gemini Audio-modellen wordt gegenereerd voorzien van een watermerk met SynthID, DeepMinds watermerktechnologie voor het identificeren van door AI gegenereerde content. Google beschrijft het watermerk als onwaarneembaar en direct verweven in de audio-uitvoer, waardoor door AI gegenereerde spraak detecteerbaar blijft om desinformatie te helpen voorkomen. Aanvullende details over de aanpak van het bedrijf op het gebied van veiligheid en verantwoordelijkheid zijn te vinden in de Gemini 3.8 audio model card.
Google wijst ook op een regionale beperking: stemreplicatie via AI Studio is niet beschikbaar in Illinois, Texas, de Europese Economische Ruimte (EER), het Verenigd Koninkrijk, Zwitserland en India.
Een stemontwerp-werkruimte in Google AI Studio
Vanaf vandaag kunnen ontwikkelaars de nieuwe mogelijkheden voor spraakgeneratie uitproberen in Google AI Studio. Gebouwd als een werkruimte voor stemontwerp, kunnen gebruikers volledig nieuwe vocale identiteiten vanaf nul prompten of hun eigen stem repliceren, en deze stemmen vervolgens direct meenemen naar een dual-speaker screenplay-editor om de levering regel voor regel te regisseren.
Developer-platformen en lanceerpartners
Via de Gemini API stellen developer-platformen waaronder Agora, LiveKit, Pipecat en Vercel — een groep die realtime communicatie-infrastructuur, spraak-frameworks en implementatietooling omvat — ontwikkelaars in staat om eenvoudig hoogwaardige spraakgeneratie-ervaringen te bouwen en in te zetten.
Google werkt ook samen met bedrijven waaronder Figma, HeyGen, Linguana, Wondercraft, 99.co en Ollang, die de nieuwste TTS-modellen integreren om wereldwijde nasynchronisatie te versnellen, media te lokaliseren met genuanceerde regionale accenten en conversationele spraakagenten op schaal aan te drijven.
Beschikbaarheid
Beide modellen worden vanaf vandaag uitgerold.
Gemini 3.8 Flash TTS:
- Voor ontwikkelaars: beschikbaar in de Gemini API en Google AI Studio.
- Voor bedrijven: binnenkort via API in Gemini Enterprise.
- Voor consumenten: beschikbaar in Gemini Notebook.
Gemini 3.8 Flash-Lite TTS:
- Voor ontwikkelaars: beschikbaar in de Gemini API en Google AI Studio.
- Voor bedrijven: binnenkort via API in Gemini Enterprise.
- Voor consumenten: beschikbaar in Google Vids.
De mogelijkheden die Google als binnenkort beschikbaar markeert — stemremixing en API-toegang via Gemini Enterprise — zijn de volgende mijlpalen om in de gaten te houden naarmate de uitrol zich uitbreidt voorbij de lanceerpartners van vandaag en de vroege toegangspunten.
Met deze release omvat de Gemini Audio-lijn live vertaling en transcriptie, realtime spraakgesprekken via 3.8 Live en 3.8 Live Extended Thinking, en nu expressieve spraakgeneratie, waarmee makers, ontwikkelaars en bedrijven één modelfamilie hebben voor het bouwen van stemgedreven producten.