Google DeepMind выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS — свои самые выразительные модели синтеза речи
Ключевые выводы
- •Google DeepMind выпустила две модели синтеза речи: Gemini 3.8 Flash TTS для выразительного дизайна персонажей и режиссуры сцен и Gemini 3.8 Flash-Lite TTS для масштабной и экономичной генерации речи.
- •Пользователи могут создавать оригинальные голоса с помощью текстовых подсказок, выбирать из библиотеки более чем 2000 готовых голосов на свыше 100 языках и диалектах и клонировать голос по 30-секундной аудиозаписи.
- •Обе модели обеспечивают построчный контроль над темпом, эмоциями, невербальными маркерами и постановкой сцен с двумя говорящими, а также могут генерировать часы непрерывного аудио с минимальным дрейфом диктора.
- •Google сообщает, что Gemini 3.8 Flash TTS заняла первое место в Voice Design Benchmark от Hume AI с результатом 71,4, а обе модели заняли два верхних места в Overall Quality Index от Hume AI.
- •Клонирование голоса требует верифицированного согласия владельца голоса, весь сгенерированный звук несет водяные знаки SynthID, а клонирование через AI Studio недоступно в регионах, включая Иллинойс, Техас, ЕЭЗ, Великобританию, Швейцарию и Индию.

Google DeepMind объявила 23 сентября 2026 года о выпуске Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — двух моделей синтеза речи, которые компания называет своими самыми выразительными моделями генерации звука на сегодняшний день. Модели создают пользовательские голоса персонажей и полностью срежиссированные диалоги в формате сцен, а их развертывание идет в Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids. Синтез речи стал быстро развивающимся направлением генеративного ИИ: производство аудиокниг, игры, дубляж и голосовые агенты реального времени формируют спрос на синтетическую речь, звучащую убедительно по-человечески.
Анонс, опубликованный в блоге Google DeepMind, подготовили Лиланд Речис (Leland Rechis), ведущий менеджер по продуктам, и Алан Коэн (Alan Cowen), директор по научным исследованиям, от имени команды Gemini Audio.
В кратком описании Google сообщает, что пользователи могут создавать пользовательские голоса с нуля или клонировать существующие с помощью простых текстовых подсказок, управлять звучанием построчно, контролируя темп, эмоции и даже реалистичные звуки разговора, а также применять модели для высококачественных аудиокниг, подкастов или масштабируемых голосовых агентов реального времени. Встроенные средства безопасности, включая водяные знаки, помогают защищать сгенерированный звук.
Две модели для разных задач
Google представляет запуск как превращение генерации голоса «из статичных пресетов в динамичную творческую студию», позволяющее создателям контента, разработчикам и компаниям строить более насыщенные и выразительные аудиовозможности. Компания добавляет, что модели также улучшают пользовательский опыт собственных продуктах, включая Gemini Notebook и Google Vids.
Gemini 3.8 Flash TTS создана для глубокого творческого управления и дизайна персонажей. Она может создавать совершенно новые голоса с нуля с помощью текстовых подсказок, оживляя персонажей в играх, иммерсивных аудиокнигах, подкастах и интерактивных медиа. Пользователи могут руководить каждым фрагментом исполнения построчно с детальным контролем актерских указаний, темпа, смен диалектов и реактивных реплик.
Gemini 3.8 Flash-Lite TTS создана для масштабной и экономичной работы. По словам Google, она оптимизирована для массового дубляжа, создания аудиоконтента и выразительных голосовых агентов с тонкой настройкой тона, темпа и выразительных нюансов. Разделение Flash и Flash-Lite следует соглашению об именовании, которое Google уже использует в семействе Gemini, где варианты Lite служат более легкими, ориентированными на стоимость решениями для высоконагруженных задач.
Обе модели дополняют быстро растущее семейство Gemini Audio, в которое ранее входили 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking.
Создание и настройка собственных голосов
С новыми моделями Google масштабируется от 30 исходных голосов к тому, что она называет бесконечной библиотекой. Нужен ли полностью оригинальный голос персонажа или постоянный «посол бренда», компания заявляет, что Gemini 3.8 Flash TTS представляет собой полноценную вокальную студию, позволяя пользователям создавать и применять выразительные, естественно звучащие голоса для любых сценариев, а разработчики и компании строят на их основе пользовательские аудиорешения.
Возможности создания голосов, объявленные сегодня, включают:
Генеративный дизайн голоса. С Gemini 3.8 Flash TTS пользователи могут создавать уникальные голоса с нуля, настраивая роль, акцент и характеристики голоса на более чем 100 языках и диалектах с помощью текстовых подсказок — будь то, по примерам Google, оживление драматичного огнедышащего дракона или создание харизматичного рассказчика с выраженным региональным выговором. Демонстрационные ролики, выпущенные вместе с постом, показывают генерацию энергичного голоса диджея из Мельбурна, тонкого монотонного голоса робота и японского дракона.
Обширная библиотека голосов. Платформа предлагает более 2000 готовых к использованию голосов с широким языковым охватом, включая региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский.
Клонирование голоса. Пользователи могут воссоздавать согласованные голосовые профили по 30-секундной аудиозаписи собственного голоса или голоса, на использование которого у них есть права. Функция поддерживается встроенной проверкой согласия, водяными знаками SynthID и учетными данными C2PA — открытым отраслевым стандартом для фиксации происхождения медиафайла и способа его создания — для защиты как разработчиков, так и их голосовых талантов.
Сохранение и масштабирование. Пользоватские голоса можно сохранять и управлять ими, чтобы обеспечить согласованность и минимальный дрейф в рамках текущих проектов.
Ремикширование голоса. Скоро пользователи смогут выбрать голос из библиотеки и настроить его тембр, высоту, темп и акцент, задавая характеристики подсказками, например «добавить легкий южный американский акцент» или «смягчить подачу».
Управление исполнением построчно
После выбора голосов обе модели TTS дают пользователям точный контроль над подачей каждой реплики. Пользователи могут писать собственные сценические указания или позволить Gemini управлять подачей с помощью естественных подсказок в сценарии — от спокойного агента службы поддержки до прошептанной сцены саспенса. Демонстрации Google показывают, как модель обеспечивает естественные, высоко выразительные диалоги для интерактивных голосовых агентов, а также детальный контроль сценария для создания увлекательного иммерсивного звука и полностью сыгранных диалоговых сцен с естественной сменой реплик.
Другие возможности исполнения включают:
Генерация длинных форматов. Модели сохраняют высокое качество голоса, естественный темп и тембр персонажа на протяжении часов непрерывного аудио с минимальным дрейфом диктора, что Google позиционирует как идеальное решение для подкастов и аудиокниг.
Встроенная постановка сцен с двумя говорящими. Многорепликовые диалоги можно плавно режиссировать из единого сценария — для подкаста или драматического повествования — сохраняя четкое разделение двух голосов с естественной сменой реплик в разговоре.
Сценарные вокальные вставки и реактивные реплики. Невербальные маркеры, такие как <laughs>, <sigh> и <gasp>, а также междометия активного слушания вроде |mhm| или |yeah| добавляют реалистичную разговорную фактуру для точного комедийного тайминга и реакций.
Бенчмарки и многоязычность
Google сообщает, что Gemini 3.8 Flash TTS демонстрирует ведущие возможности кастомизации голоса, заняв первое общее место в Voice Design Benchmark от Hume AI — сторонней оценке от специализирующейся на голосе исследовательской компании Hume AI, — с результатом 71,4, а также лидирует в моделировании акцентов с показателем 60,8. Компания добавляет, что Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS обеспечивают выразительное исполнение без ущерба для надежности, заняв первое и второе места соответственно в Overall Quality Index от Hume AI.
По сравнению с Gemini 3.1 Flash TTS, по словам Google, новая модель демонстрирует значительные улучшения в широком спектре сценариев, включая длинные форматы и управление сценариями с двумя говорящими.
В слепых оценках человеческих предпочтений на Voice Arena, где слушатели сравнивают анонимизированные образцы, не зная, какая модель их создала, Gemini 3.8 Flash и Flash-Lite TTS заняли ведущие позиции среди конкурентов на ключевых мировых языках, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский (MSA), мексиканский испанский и хинди. При поддержке более 100 языков, по заявлению компании, модели позволяют создателям, разработчикам и компаниям создавать качественные многоязычные голос решения по всему миру.
Безопасность, согласие и прозрачность
Google заявляет, что возможности создания и клонирования голоса построены со строгими мерами защиты для охраны голосовых талантов, уважения к личности и обеспечения прозрачности контента. Для клонирования голоса система использует проверку согласия: пользователи должны предоставить голосовую запись согласия от владельца голоса, соответствующую эталонному диктору, прежде чем голос может быть создан. Эти меры затрагивают один из наиболее обсуждаемых рисков генеративного аудио: злоупотребление клонированными голосами для выдачи себя за другого человека и мошенничества, что сделало процессы согласия и верификации центральным пунктом дебатов о политике в области ИИ.
Более того, каждый аудиофрагмент, сгенерированный моделями Gemini Audio, снабжается водяным знаком SynthID — технологией водяных знаков DeepMind для идентификации контента, созданного ИИ. Google описывает водяной знак как незаметный и встроенный непосредственно в аудиовыход, что сохраняет возможность обнаружения ИИ-речи для противодействия дезинформации. Дополнительные сведения о подходе компании к безопасности и ответственности доступны в карте модели Gemini 3.8 audio.
Google также отмечает региональное ограничение: клонирование голоса через AI Studio недоступно в Иллинойсе, Техасе, Европейской экономической зоне (ЕЭЗ), Великобритании, Швейцарии и Индии.
Студия дизайна голоса в Google AI Studio
С сегодняшнего дня разработчики могут попробовать новые возможности генерации речи в Google AI Studio. Инструмент устроен как рабочее пространство для дизайна голоса: пользователи могут создать совершенно новые голосовые образы с нуля или клонировать собственный голос, а затем перенести их непосредственно в редактор сценариев с двумя говорящими для построчного управления подачей.
Платформы разработчиков и партнеры запуска
Через Gemini API платформы для разработчиков, включая Agora, LiveKit, Pipecat и Vercel — группу, охватывающую инфраструктуру связи в реальном времени, фреймворки голосовых агентов и инструменты развертывания, — позволяют разработчикам легко создавать и развертывать высокопроизводительные решения генерации речи.
Google также сотрудничает с компаниями, включая Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang, которые интегрируют новейшие модели TTS для ускорения глобального дубляжа, локализации медиа с тонкими региональными акцентами и масштабирования разговорных голосовых агентов.
Доступность
Обе модели начинают развертываться с сегодняшнего дня.
Gemini 3.8 Flash TTS:
- Для разработчиков: доступна в Gemini API и Google AI Studio.
- Для компаний: скоро через API в Gemini Enterprise.
- Для всех пользователей: доступна в Gemini Notebook.
Gemini 3.8 Flash-Lite TTS:
- Для разработчиков: доступна в Gemini API и Google AI Studio.
- Для компаний: скоро через API в Gemini Enterprise.
- Для всех пользователей: доступна в Google Vids.
Возможности, отмеченные Google как «скоро» — ремикширование голоса и доступ через API в Gemini Enterprise, — следующие вехи, за которыми стоит следить по мере расширения развертывания за пределы сегодняшних партнеров запуска и точек раннего доступа.
С этим релизом линейка Gemini Audio охватывает синхронный перевод и транскрипцию, голосовое общение в реальном времени через 3.8 Live и 3.8 Live Extended Thinking, а теперь и выразительную генерацию речи, предоставляя создателям, разработчикам и компаниям единое семейство моделей для создания голосовых продуктов.