AktualnościAkcjeGoogle DeepMind uruchamia Gemini 3.8 Flash TTS i Flash-Lite TTS — swoje najbardziej ekspresyjne modele zamiany tekstu na mowę

Google DeepMind uruchamia Gemini 3.8 Flash TTS i Flash-Lite TTS — swoje najbardziej ekspresyjne modele zamiany tekstu na mowę

Autor: Google DeepMind Blog·

Najważniejsze informacje

  • Google DeepMind uruchomiło dwa modele zamiany tekstu na mowę: Gemini 3.8 Flash TTS, zaprojektowany do ekspresyjnego projektowania postaci i reżyserii scen, oraz Gemini 3.8 Flash-Lite TTS, przeznaczony do wydajnej kosztowo generacji mowy na dużą skalę.
  • Użytkownicy mogą projektować oryginalne głosy za pomocą poleceń w języku naturalnym, wybierać z biblioteki ponad 2000 gotowych do produkcji głosów obejmujących ponad 100 języków i dialektów oraz replikować głos z 30-sekundowej próbki audio.
  • Oba modele zapewniają kontrolę linijka po linijce nad tempem, emocjami, sygnałami niewerbalnymi i reżyserowaniem scen dwuosobowych, a także mogą generować godziny ciągłego audio przy minimalnych odchyleniach mówcy.
  • Google informuje, że Gemini 3.8 Flash TTS zajął pierwsze miejsce w Voice Design Benchmark firmy Hume AI z wynikiem 71,4, a oba modele zajęły dwa czołowe miejsca w Overall Quality Index Hume AI.
  • Replikacja głosu wymaga zweryfikowanej zgody właściciela głosu, całe generowane audio jest znakowane SynthID, a replikacja przez AI Studio jest niedostępna w regionach takich jak Illinois, Teksas, EOG, Wielka Brytania, Szwajcaria i Indie.
Google DeepMind uruchamia Gemini 3.8 Flash TTS i Flash-Lite TTS — swoje najbardziej ekspresyjne modele zamiany tekstu na mowę

Google DeepMind ogłosiło 23 września 2026 roku wydanie 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS — dwóch modeli zamiany tekstu na mowę, które firma opisuje jako swoje najbardziej ekspresyjne modele generowania audio do date. Modele generują niestandardowe głosy postaci oraz w pełni wyreżyserowane dialogi sceniczne i są udostępniane w Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook oraz Google Vids. Zamiana tekstu na mowę stała się szybko rozwijającym się obszarem generatywnej sztucznej inteligencji — produkcja audiobooków, gry, dubbing i agenci głosowi działający w czasie rzeczywistym napędzają popyt na syntetyczną mowę brzmiącą przekonująco ludzko.

Ogłoszenie, opublikowane na blogu Google DeepMind, zostało autorstwa Lelanda Rechisa, Group Product Managera, oraz Alana Cowena, Dyrektora ds. Badań Naukowych, piszącego w imieniu zespołu Gemini Audio.

W podsumowaniu Google informuje, że użytkownicy mogą tworzyć niestandardowe głosy od zera lub replikować istniejące za pomocą prostych poleceń w języku naturalnym, reżyserować swoje audio linijka po linijce, kontrolując tempo, emocje, a nawet realistyczne dźwięki konwersacyjne, oraz wykorzystywać modele do wysokiej jakości audiobooków, podcastów lub agentów głosowych działających w czasie rzeczywistym na dużą skalę. Wbudowane narzędzia bezpiestwa, w tym znakowanie wodne, mają pomóc w zabezpieczeniu wygenerowanego audio.

Dwa modele do różnych zadań

Google opisuje premierę jako przekształcenie generowania głosu "ze statycznych presetów w dynamiczne studio kreatywne", umożliwiające twórcom, programistom i przedsiębiorstwom budowanie bogatszych, bardziej ekspresyjnych doświadczeń audio. Firma dodaje, że modele poprawiają również doświadczenia użytkowników we własnych produktach, w tym w Gemini Notebook i Google Vids.

Gemini 3.8 Flash TTS został zaprojektowany do głębokiej reżyserii i projektowania postaci. Może tworzyć całkowicie nowe głosy od zera za pomocą poleceń w języku naturalnym, ożywiając postacie w grach, immersyjnych audiobookach, podcastach i mediach interaktywnych. Użytkownicy mogą reżyserować każde wykonanie linijka po linijce, ze szczegółową kontrolą nad wskazówkami aktorskimi, tempem, zmianami dialektu i backchannelingiem.

Gemini 3.8 Flash-Lite TTS został zaprojektowany do wydajnej kosztowo pracy na dużą skalę. Google informuje, że jest zoptymalizowany do dubbingu o dużej objętości, tworzenia treści audio oraz ekspresyjnych agentów głosowych, z drobnoziarnistą kontrolą tonu, tempa i niuansów ekspresji. Podział na Flash i Flash-Lite wpisuje się w konwencję nazewniczą stosowaną już przez Google w rodzinie Gemini, gdzie warianty Lite stanowią lżejsze, zorientowane na koszty opcje dla zadań o wysokiej przepustowości.

Dwa modele uzupełniają szybko rosnącą rodzinę Gemini Audio, do której wcześniej należały 3.5 Live Translate, 3.5 Transcribe, 3.8 Live oraz 3.8 Live Extended Thinking.

Twórz i dostosowuj własne głosy

Dzięki nowym modelom Google rozszerza ofertę z 30 oryginalnych głosów do tego, co nazywa nieskończoną biblioteką. Niezależnie od tego, czy celem jest całkowicie oryginalny głos postaci, czy spójny ambasador marki, firma informuje, że Gemini 3.8 Flash TTS działa jak pełne studio wokalne, pozwalając użytkownikom tworzyć i wdrażać ekspresyjne, naturalnie brzmiące głosy, podczas gdy programiści i przedsiębiorstwa budują na nich własne doświadczenia audio.

Możliwości tworzenia głosów ogłoszone dziś obejmują:

Generatywne projektowanie głosu. Użytkownicy mogą tworzyć głosy na zamówienie od zera w Gemini 3.8 Flash TTS, dostosowując rolę, akcent i cechy głosu w ponad 100 językach i dialektach za pomocą poleceń w języku naturalnym — czy to ożywiając, według przykładów Google, dramatycznego, zionącego ogniem smoka, czy tworząc charyzmatycznego narratora z wyraźnym regionalnym rytmem. Klipy demonstracyjne opublikowane wraz z wpisem pokazują model generujący energetyczny głos DJ-a Melbourne, super cienki, monotonny głos robota oraz japońskiego smoka.

Rozbudowana biblioteka głosów. Platforma oferuje ponad 2000 gotowych do produkcji głosów z szeroką obsługą języków, w tym odmian regionalnych, takich jak meksykański hiszpański, quebecki francuski i szkocki angielski.

Replikacja głosu. Użytkownicy mogą odtworzyć spójne profile głosowe z 30-sekundowej próbki audio własnego głosu lub głosu, do którego mają prawa. Funkcja jest wsparta wbudowaną weryfikacją zgody, znakiem wodnym SynthID oraz poświadczeniami C2PA — otwartym standardem branżowym rejestrującym pochodzenie materiału i sposób jego produkcji — aby chronić zarówno programistów, jak i ich talenty głosowe.

Zapisywanie i skalowanie. Niestandardowe głosy można zapisywać i zarządzać nimi, aby zapewnić spójną wydajność i minimalne odchylenia w trwających projektach.

Remiksowanie głosu. Wkrótce użytkownicy będą mogli wybrać głos z biblioteki i dostroić jego barwę, wysokość, tempo i akcent, używając poleceń do określania cech, takich jak "dodaj subtelny południowy akcent amerykański" lub "zmiękcz sposób mówienia".

Reżyseruj wykonanie, linijka po linijce

Po wybraniu głosów oba modele TTS dają użytkownikom precyzyjną kontrolę nad tym, jak każda linijka jest wypowiadana. Użytkownicy mogą pisać własne didaskalia lub pozwolić Gemini kierować wykonaniem za pomocą naturalnych wskazówek w scenariuszu — od spokojnego agenta obsługi klienta po szeptany scenę suspensu. Dema Google pokazują model napędzający naturalne, wysoce ekspresyjne rozmowy dla interaktywnych agentów głosowych, a także drobnoziarnistą kontrolę scenariusza służącą do budowania wciągających, immersyjnych doświadczeń audio i w pełni odegranych scen dialogowych z naturalną zmianą rolów.

Inne możliwości wykonawcze obejmują:

Generowanie długich form. Modele utrzymują wysoką jakość głosu, naturalne tempo i barwę postaci przez godziny ciągłego audio przy minimalnych odchyleniach mówcy, co Google przedstawia jako idealne do podcastów i audiobooków.

Natywne reserowanie scen dwuosobowych. Rozmowy wieloetapowe można reżyserować płynnie z jednego scenariusza — czy to dla podcastu, czy dramatycznej opowieści — zachowując wyraźne rozróżnienie obu głosów przy naturalnej, konwersacyjnej zmianie rolów.

Skryptowane wybuchy głosowe i backchanneling. Niewerbalne wskazówki, takie jak <laughs>, <sigh> i <gasp>, wraz z interjekcjami aktywnego słuchania, takimi jak |mhm| czy |yeah|, dodają realistyczną teksturę rozmowy dla precyzyjnego timing komediowego i momentów reakcji.

Benchmarki i zasięg wielojęzyczny

Google informuje, że Gemini 3.8 Flash TTS oferuje wiodące możliwości dostosowywania głosu, zajmując pierwsze miejsce ogółem w Voice Design Benchmark firmy Hume AI, niezależnej ocenie od specjalizującej się w głosie firmy badawczej Hume AI, z wynikiem 71,4, a także prowadzi w modelowaniu akcentu z wynikiem 60,8. Firma dodaje, że Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS umożliwiają ekspresyjne wykonania bez utraty niezawodności, zajmując odpowiednio pierwsze i drugie miejsce w Overall Quality Index Hume AI.

W porównaniu z Gemini 3.1 Flash TTS Google informuje, że nowy model wykazuje znaczne ulepszenia w szerokim zakresie zastosowań, w tym w treściach długich i kontroli scenariusza dwuosobowego.

W ślepych testach preferencji ludzkich na Voice Arena, gdzie słuchacze porównują anonimizowane próbki bez znajomości modelu, który je wygenerował, Gemini 3.8 Flash i Flash-Lite TTS zajęły czołowe pozycje wśród konkurentów w kluczowych językach globalnych, w tym japońskim, brazylijskim portugalskim, wietnamskim, współczesnym standardowym arabskim (MSA), meksykańskim hiszpańskim i hindi. Dzięki obsłudze ponad 100 języków firma informuje, że modele umożliwiają twórcom, programistom i przedsiębiorstwom budowanie wysokiej jakości, wielojęzycznych doświadczeń głosowych na całym świecie.

Bezpieczeństwo, zgoda i przejrzystość

Google informuje, że możliwości tworzenia i replikacji głosu zostały zbudowane ze ścisłymi zabezpieczeniami, aby chronić talenty głosowe, szanować tożsamość i zapewniać przejrzystość treści. W przypadku replikacji głosu system wykorzystuje weryfikację zgody: użytkownicy muszą dostarczyć nagranie zgody głosowej od właściciela głosu, które odpowiada głosowi referencyjnemu, zanim głos może zostać utworzony. Zabezpieczenia odnoszą się do jednego z najbardziej obserwowanych ryzyk w generatywnym audio: niewłaściwego wykorzystania sklonowanych głosów do podszywania się i oszustw, co uczyniło procesy zgody i weryfikacji punktem centralnym debat o polityce AI.

Szej, każdy klip audio wygenerowany przez modele Gemini Audio jest znakowany SynthID, technologią znakowania wodnego DeepMind służącą do identyfikacji treści generowanych przez AI. Google opisuje znak wodny jako niewykrywalny dla ucha i wpleciony bezpośrednio w wyjściowe audio, dzięki czemu mowa generowana przez AI pozostaje wykrywalna, aby pomóc zapobiegać dezinformacji. Dodatkowe informacje o podejściu firmy do bezpieczeństwa i odpowiedzialności są dostępne w karcie modelu Gemini 3.8 audio.

Google odnotowuje również ograniczenie regionalne: replikacja głosu przez AI Studio nie jest dostępna w Illinois, Teksasie, Europejskim Obszarze Gospodarczym (EOG), Wielkiej Brytanii, Szwajcarii i Indiach.

Studio projektowania głosu w Google AI Studio

Od dziś programiści mogą wypróbować nowe możliwości generowania mowy w Google AI Studio. Narzędzie, zbudowane jak przestrzeń robocza do projektowania głosu, pozwala użytkownikom generować zupełnie nowe tożsamości wokalne od zera lub replikować własny głos, a następnie przenosić je bezpośrednio do edytora scenariusza dwuosobowego, aby reżyserować wykonanie linijka po linijce.

Platformy deweloperskie i partnerzy premiery

Za pośrednictwem Gemini API platformy deweloperskie, w tym Agora, LiveKit, Pipecat i Vercel — grupa obejmująca infrastrukturę komunikacji w czasie rzeczywistym, frameworki agentów głosowych i narzędzia do wdrożeń — umożliwiają programistom łatwe budowanie i wdrażanie wydajnych doświadczeń generowania mowy.

Google współpracuje również z firmami takimi jak Figma, HeyGen, Linguana, Wondercraft, 99.co i Ollang, które integrują najnowsze modele TTS, aby przyspieszyć globalny dubbing, lokalizować media z niuansami regionalnych akcentów i napędzać konwersacyjnych agentów głosowych na dużą skalę.

Dostępność

Oba modele są udostępniane od dziś.

Gemini 3.8 Flash TTS:

  • Dla programistów: dostępny w Gemini API i Google AI Studio.
  • Dla przedsiębiorstw: wkrótce przez API w Gemini Enterprise.
  • Dla konsumentów: dostępny w Gemini Notebook.

Gemini 3.8 Flash-Lite TTS:

  • Dla programistów: dostępny w Gemini API i Google AI Studio.
  • Dla przedsiębiorstw: wkrótce przez API w Gemini Enterprise.
  • Dla konsumentów: dostępny w Google Vids.

Możliwości oznaczone przez Google jako "wkrótce" — remiksowanie głosu i dostęp przez API w Gemini Enterprise — to kolejne kamienie milowe, na które warto zwracać uwagę, wraz z rozszerzaniem wdrożenia poza dzisiejszych partnerów premiery i punkty wczesnego dostępu.

Dzięki temu wydaniu oferta Gemini Audio obejmuje tłumaczenie i transkrypcję żywo, rozmowy głosowe w czasie rzeczywistym przez 3.8 Live i 3.8 Live Extended Thinking, a teraz także ekspresyjne generowanie mowy, dając twórcom, programistom i przedsiębiorstwom jedną rodzinę modeli do budowania produktów opartych na głosie.