NachrichtenAktienGoogle DeepMind veröffentlicht Gemini 3.8 Flash TTS und Flash-Lite TTS, die bislang ausdrucksstärksten Text-zu-Sprache-Modelle

Google DeepMind veröffentlicht Gemini 3.8 Flash TTS und Flash-Lite TTS, die bislang ausdrucksstärksten Text-zu-Sprache-Modelle

Autor: Google DeepMind Blog·

Wichtige Erkenntnisse

  • Google DeepMind hat zwei Text-zu-Sprache-Modelle veröffentlicht: Gemini 3.8 Flash TTS, gebaut für ausdrucksstarkes Charakterdesign und Szenenregie, und Gemini 3.8 Flash-Lite TTS, gebaut für hochvolumige, kosteneffiziente Sprachgenerierung.
  • Nutzer können originale Stimmen über natürlichsprachliche Prompts entwerfen, aus einer Bibliothek mit mehr als 2.000 produktionsreifen Stimmen in über 100 Sprachen und Dialekten wählen und eine Stimme aus einem 30-sekündigen Audio-Sample replizieren.
  • Beide Modelle bieten Kontrolle Zeile für Zeile über Tempo, Emotionen, nonverbale Hinweise und Zwei-Sprecher-Szeneninszenierung und können Stunden kontinuierlicher Audio-Ausgabe mit minimalem Sprecherdrift erzeugen.
  • Google berichtet, dass Gemini 3.8 Flash TTS den ersten Platz auf Hume AIs Voice Design Benchmark mit einem Score von 71,4 belegte und die beiden Modelle die Top-Plätze auf Hume AIs Overall Quality Index erreichten.
  • Die Stimmreplikation erfordert eine verifizierte Einwilligung des Stimmeigentümers, alle generierten Audiodateien tragen SynthID-Wasserzeichen, und die Replikation über AI Studio ist in Regionen wie Illinois, Texas, dem EWR dem Vereinigten Königreich, der Schweiz und Indien nicht verfügbar.
Google DeepMind veröffentlicht Gemini 3.8 Flash TTS und Flash-Lite TTS, die bislang ausdrucksstärksten Text-zu-Sprache-Modelle

Google DeepMind gab am 23. September 2026 die Veröffentlichung von Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS bekannt, zweier Text-zu-Sprache-Modelle, die das Unternehmen als seine bislang ausdrucksstärksten Audio-Generierungsmodelle bezeichnet. Die Modelle erzeugen eigene Charakterstimmen und vollständig inszenierte, szenenbasierte Dialoge und werden über Google AI Studio, die Gemini API, Gemini Enterprise, Gemini Notebook und Google Vids ausgerollt. Text-zu-Sprache ist zu einem sich rasch entwickelnden Bereich der generativen KI geworden, wobei Hörbuchproduktion, Gaming, Synchronisation und Echtzeit-Sprachagenten die Nachfrage nach synthetischer Sprache antreiben, die überzeugend menschlich klingt.

Die Ankündigung, veröffentlicht im Google DeepMind Blog, stammt von Leland Rechis, Group Product Manager, und Alan Cowen, Director of Research Science, im Namen des Gemini Audio Teams.

In seiner Zusammenfassung sagt Google, dass Nutzer eigene Stimmen von Grund auf erstellen oder bestehende replizieren können – mit einfachen natürlichsprachlichen Prompts –, ihre Audioaufnahmen Zeile für Zeile anleiten können, um Tempo, Emotionen und sogar realistische Gesprächsgeräusche zu steuern, und die Modelle für hochwertige Hörbücher, Podcasts oder skalierbare Echtzeit-Sprachagenten nutzen können. Integrierte Sicherheitsfunktionen wie Wasserzeichen tragen zur Sicherheit der generierten Audiodateien bei.

Zwei Modelle für unterschiedliche Workloads

Google rahmt den Launch als Verwandlung Sprachgenerierung "von statischen Presets in ein dynamisches Kreativstudio", das Creators, Entwicklern und Unternehmen reichhaltigere, ausdrucksstärkere Audio-Erlebnisse ermöglicht. Das Unternehmen fügt hinzu, dass die Modelle auch verbesserte Nutzererlebnisse in den eigenen Produkten wie Gemini Notebook und Google Vids ermöglichen.

Gemini 3.8 Flash TTS ist für tiefgehende kreative Regie und Charakterdesign konzipiert. Es kann völlig neue Stimmen von Grund auf erstellen, indem natürlichsprachliche Prompts verwendet werden, um Charaktere in Gaming, immersiven Hörbüchern, Podcasts und interaktiven Medien zum Leben zu erwecken. Nutzer können jede Darbietung Zeile für Zeile anleiten, mit feingranularer Kontrolle über Schauspielhinweise, Tempo, Dialektwechsel und Backchanneling.

Gemini 3.8 Flash-Lite TTS ist für hochvolumige, kosteneffiziente Skalierung gebaut. Google sagt, es sei für hochvolumige Synchronisation, Audio-Content-Erstellung und ausdrucksstarke Sprachagenten optimiert, mit feiner Kontrolle über Tonfall, Tempo und expressive Nuancen. Die Aufteilung in Flash und Flash-Lite folgt der Namenskonvention, die Google bereits in der Gemini-Familie verwendet, bei der Lite-Varianten leichtere, kostenorientierte Optionen für hochdurchsatzintensive Workloads sind.

Die beiden Modelle ergänzen eine schnell wachsende Gemini-Audio-Familie, die zuvor 3.5 Live Translate, 3.5 Transcribe, 3.8 Live und 3.8 Live Extended Thinking umfasste.

Eigene Stimmen erstellen und anpassen

Mit den neuen Modellen skaliert Google von 30 ursprünglichen Stimmen auf das, was es eine unendliche Bibliothek nennt. Ob das Ziel eine völlig originale Charakterstimme oder ein konsistenter Markenbotschafter ist – das Unternehmen sagt, Gemini 3.8 Flash TTS stelle ein komplettes Vocal-Studio bereit, mit dem Nutzer ausdrucksstarke, natürlich klingende Stimmen für jeden Moment erstellen und einsetzen können, während Entwickler und Unternehmen darauf aufbauend eigene Audio-Erlebnisse gestalten.

Zu den heute angekündigten Funktionen zur Stimmerstellung gehören:

Generatives Stimmdesign. Nutzer können mit Gemini 3.8 Flash TTS maßgeschneiderte Stimmen von Grund auf erstellen, indem sie Rolle, Akzent und Stimmmerkmale in mehr als 100 Sprachen und Dialekten über natürlichsprachliche Prompts anpassen – sei es, um in Googles Beispielen einen dramatischen, feurig-atmenden Drachen zum Leben zu erwecken oder einen charismatischen Erzähler mit ausgeprägtem regionalem Sprachrhythmus zu gestalten. Neben dem Beitrag veröffentlichte Demo-Clips zeigen, wie das Modell eine energiegeladene DJ-Stimme aus Melbourne, eine extrem dünne, monotone Roboterstimme und einen japanischen Drachen erzeugt.

Umfangreiche Stimmbibliothek. Die Plattform bietet mehr als 2.000 produktionsife Stimmen mit breiter Sprachabdeckung, darunter regionale Varianten wie mexikanisches Spanisch, québecer Französisch und schottisches Englisch.

Stimmreplikation. Nutzer können konsistente Stimmprofile aus einem 30-sekündigen Audio-Sample ihrer eigenen Stimme oder einer Stimme, für die sie die Nutzungsrechte besitzen, nachbilden. Die Funktion wird durch integrierte Consent-Verifizierung, SynthID-Wasserzeichen und C2PA-Anmeldeinformationen unterstützt – einen offenen Industriestandard zur Dokumentation von Herkunft und Entstehung eines Mediums – um sowohl Entwickler als auch deren Sprecher zu schützen.

Speichern und skalieren. Eigene Stimmen können gespeichert und verwaltet werden, um konsistente Leistung und minimale Abweichung über laufende Projekte hinweg sicherzustellen.

Stimm-Remixing. Bald können Nutzer eine Stimme aus der Bibliothek auswählen und Klangfarbe, Tonhöhe, Tempo und Akzent feinjustieren, mit Prompts zur Feinabstimmung von Merkmalen wie "add subtle Southern US accent" oder "soften the delivery".

Die Darbietung Zeile für Zeile inszenieren

Nach Auswahl der Stimmen geben beide TTS-Modelle den Nutzern präzise Kontrolle darüber, wie jede Zeile gesprochen wird. Nutzer können eigene Regieanweisungen schreiben oder Gemini die Sprechweise mit natürlichen Skript-Hinweisen steuern lassen – von einem ruhigen Kundendienstmitarbeiter bis zu einer geflüsterten Suspense-Szene. Googles Demos zeigen, wie das Modell natürliche, hochgradig ausdrucksstarke Gespräche für interaktive Sprachagenten ermöglicht, sowie feingranulare Skript-Kontrolle für tief eindringliche, immersive Audio-Erlebnisse und vollständig inszenierte Dialogszenen mit natürlichem Sprecherwechsel.

Weitere Leistungsfunktionen umfassen:

Langform-Generierung. Die Modelle halten hohe Stimmqualität, natürliches Tempo und Stimmklang über Stunden kontinuierlicher Audio-Ausgabe mit minimalem Sprecherdrift – laut Google ideal für Podcasts und Hörbücher.

Native Zwei-Sprecher-Szeneninszenierung. Mehrrunden-Gespräche lassen sich nahtlos aus einem einzigen Skript inszenieren – ob für einen Podcast oder dramatisches Storytelling –, während beide Stimmen mit natürlichem Gesprächswechsel klar getrennt bleiben.

Skriptierte Lauteinblendungen und Backchanneling. Nonverbale Hinweise wie <laughs>, <sigh> und <gasp> sowie aktive Zuhör-Interjektionen wie |mhm| oder |yeah| verleihen realistische Gesprächsstruktur für präzises comedic Timing und Reaktionsmomente.

Benchmarks und mehrsprachige Reichweite

Google berichtet, dass Gemini 3.8 Flash TTS führende Fähigkeiten zur Stumanpassung bietet und den Gesamtrang #1 auf Hume AIs Voice Design Benchmark, unabhängigen Bewertung des auf Stimme spezialisierten KI-Forschungsunternehmens Hume AI, mit einem Score von 71,4 belegt, while auch in Akzentmodellierung mit 60,8 führt. Das Unternehmen fügt hinzu, dass Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS ausdrucksstarke Darbietungen ohne Einbußen bei der Zuverlässigkeit ermöglichen und die Plätze #1 bzw. #2 auf Hume AIs Overall Quality Index belegen.

Im Vergleich zu Gemini 3.1 Flash TTS zeigt das neue Modell laut Google deutliche Verbesserungen in einer breiten Palette von Anwendungsfällen, darunter Langform-Inhalte und die Steuerung von Zwei-Sprecher-Drehbüchern.

In verblindeten menschlichen Präferenzbewertungen auf Voice Arena, bei denen Zuhörer anonymisierte Samples vergleichen, ohne zu wissen, welches Modell sie erzeugt hat, belegten Gemini 3.8 Flash und Flash-Lite TTS Spitzenpositionen unter den Wettbewerbern in wichtigen globalen Sprachen, darunter Japanisch, brasilianisches Portugiesisch, Vietnamesisch, Modernes Standardarabisch (MSA), mexikanisches Spanisch und Hindi. Mit Unterstützung für mehr als 100 Sprachen, so das Unternehmen, ermöglichen die Modelle Creators, Entwicklern und Unternehmen den Aufbau hochwertiger, mehrsprachiger Stimmen-Erlebnisse weltweit.

Sicherheit, Einwilligung und Transparenz

Google sagt, die Funktionen zur Stimmerstellung und -replikation seien mit strengen Schutzmaßnahmen gebaut worden, um Sprecher zu schützen, Identität zu respektieren und Inhaltstransparenz sicherzustellen. Für die Stimmreplikation nutzt das System eine Consent-Verifizierung: Nutzer müssen eine verbale Einwilligungsaufnahme des Stimmeigentümers vorlegen, die mit der Referenzsprecherin oder dem Referenzsprecher übereinstimmt, bevor eine Stimme erstellt werden kann. Diese Schutzmaßnahmen adressieren eines der am stärksten beobachteten Risiken generativer Audio-Technologie: den Missbrauch geklonter Stimmen für Identitätsmissbrauch und Betrug, was Einwilligungs- und Verifizierungs-Workflows zu einem Brennpunkt der KI-Politikdebatte gemacht hat.

Darüber hinaus ist jede von den Gemini-Audio-Modellen generierte Audiodatei mit SynthID gewässert, DeepMinds Wasserzeichen-Technologie zur Identifizierung KI-generierter Inhalte. Google beschreibt das Wasserzeichen als nicht wahrnehmbar und direkt in die Audioausgabe eingewoben, sodass KI-generierte Sprache erkennbar bleibt, um Fehlinformationen vorzubeugen. Weitere Details zum Sicherheits- und Verantwortungsansatz des Unternehmens finden sich in der Gemini 3.8 Audio Model Card.

Google weist auch auf eine regionale Einschränkung hin: Die Stimmreplikation über AI Studio ist in Illinois, Texas, dem Europäischen Wirtschaftsraum (EWR), dem Vereinigten Königreich, der Schweiz und Indien nicht verfügbar.\n## Ein Voice-Design-Workspace in Google AI Studio

Ab heute können Entwickler die neuen Sprachgenerierungsfunktionen in Google AI Studio ausprobieren. Das Tool ist wie ein Voice-Design-Workspace aufgebaut: Nutzer können völlig neue Stimmidentitäten von Grund auf per Prompt erzeugen oder ihre eigene Stimme replizieren und diese dann direkt in einen Zwei-Sprecher-Drehbucheditor überführen, um die Sprechweise Zeile für Zeile zu inszenieren.

Entwicklerplattformen und Launch-Partner

Über die Gemini API ermöglichen Entwicklerplattformen wie Agora, LiveKit, Pipecat und Vercel – eine Gruppe, die Echtzeit-Kommunikationsinfrastruktur, Voice-Agent-Frameworks und Deployment-Tooling umfasst – Entwicklern den einfachen Aufbau und Einsatz leistungsstarker Sprachgenerierungs-Erlebnisse.

Google kooperiert außerdem mit Unternehmen wie Figma, HeyGen, Linguana, Wondercraft, 99.co und Ollang, die die neuesten TTS-Modelle integrieren, um globale Synchronisation zu beschleunigen, Medien mit differenzierten regionalen Akzenten zu lokalisieren und skalierbare dialogische Sprachagenten zu betreiben.

Verfügbarkeit

Beide Modelle werden ab heute ausgerollt.

Gemini 3.8 Flash TTS:

  • Für Entwickler: verfügbar in der Gemini API und Google AI Studio.
  • Für Unternehmen: demnächst per API in Gemini Enterprise.
  • Für Verbraucher: verfügbar in Gemini Notebook.

Gemini 3.8 Flash-Lite TTS:

  • Für Entwickler: verfügbar in der Gemini API und Google AI Studio.
  • Für Unternehmen: demnächst per API in Gemini Enterprise.
  • Für Verbraucher: verfügbar in Google Vids.

Die Funktionen, die Google als demnächst verfügbar markiert – Stimm-Remixing und API-Zugriff über Gemini Enterprise –, sind die nächsten Meilensteine, die zu beobachten sind, während das Rollout über die heutigen Launch-Partner und Early-Access-Zugänge hinausgeht.

Mit der Veröffentlichung umfasst die Gemini-Audio-Produktreihe Live-Übersetzung und -Transkription, Echtzeit-Sprachgespräche durch 3.8 Live und 3.8 Live Extended Thinking und nun ausdrucksstarke Sprachgenerierung – und bietet Creators, Entwicklern und Unternehmen eine einzige Modellfamilie für den Aufbau sprachgesteuerter Produkte.