Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS:迄今最具表现力的文本转语音模型
要点速览
- •Google DeepMind 发布了两款文本转语音模型:面向富有表现力的角色设计和场景指导的 Gemini 3.8 Flash TTS,以及面向大批量、高性价比语音生成的 Gemini 3.8 Flash-Lite TTS。
- •用户可以通过自然语言提示词设计原创声音,从涵盖 100 多种语言和方言的 2,000 多个可用于生产环境的声音库中进行选择,并从 30 秒音频样本复刻声音。
- •两款模型均提供对节奏、情绪、非语言提示和双说话人场景调度的逐行控制,并能在数小时连续音频中保持极小的说话人漂移。
- •Google 报告称 Gemini 3.8 Flash TTS 以 71.4 分位列 Hume AI Voice Design Benchmark 第一,两款模型在 Hume AI 整体质量指数上包揽前两名。
- •声音复刻需要声音所有者的经验证同意,所有生成音频均带有 SynthID 水印,且通过 AI Studio 进行的复刻在伊利诺伊州、得克萨斯州、欧洲经济区英国、瑞士和印度等地区不可用。

Google DeepMind 于 2026 年 9 月 23 日宣布发布 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,称其为迄今最具表现力的音频生成模型。这两款模型可生成定制角色声音和完整导演的场景对话,并正在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中陆续推出。文本转语音已成为生成式 AI 中快速发展的领域,有声书制作、游戏、配音和实时语音代理都在推动对逼真人类语音合成技术的需求。
这篇发布在 Google DeepMind 博客上的公告由集团产品经理 Leland Rechis 以及代表 Gemini 音频团队撰稿的研究科学总监 Alan Cowen 撰写。
在摘要中,Google 表示用户可以通过简单的自然语言提示词从零创建定制声音或复刻现有声音,逐行指导音频以控制节奏、情绪甚至逼真的对话音效,并将模型用于高质量的有声书、播客或大规模实时语音代理。模型还内置了包括水印在内的安全工具,帮助保障生成音频的安全。
面向不同工作负载的两款模型
Google 将此次发布形容为将语音生成"从静态预设转变为动态创意工作室",使创作者、开发者和企业能够构建更丰富、更具表现力的音频体验。该公司补充称,这些模型也改善了其自身产品(包括 Gemini Notebook 和 Google Vids)的用户体验。
Gemini 3.8 Flash TTS 面向深度创意指导和角色设计。它可以通过自然语言提示词从零创建全新声音,为游戏、沉浸式有声书、播客和互动媒体中的角色注入生命力。用户可以逐行指导每一段表演,对表演提示、节奏、方言转换和接话反馈进行细粒度控制。
Gemini 3.8 Flash-Lite TTS 则面向大批量、高性价比的规模化场景。Google 表示它针对高吞吐量配音、音频内容创作和富有表现力的语音代理进行了优化,可对语气、节奏和表达细节进行精细控制。Flash 与 Flash-Lite 的划分延续了 Google 在 Gemini 家族中已有的命名惯例,Lite 变体作为更轻量、更注重成本的选项服务高吞吐量工作负载。
这两款模型是对快速壮大的 Gemini 音频家族的补充,此前该家族已包括 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking。
创建并定制你自己的声音
通过新模型,Google 将最初的 30 个原始声音扩展为其所称的无限声音库。无论是需要完全原创的角色声音还是一致的品牌代言声音,该公司表示 Gemini 3.8 Flash TTS 相当于一个完整的语音工作室,让用户能够为每个场景创建和使用富有表现力、自然听感的声音,同时开发者与企业也能在其基础上定制音频体验。
今天公布的语音创建功能包括:
生成式声音设计。 用户可以通过 Gemini 3.8 Flash TTS 从零创建定制声音,利用自然语言提示词在 100 多种语言和方言中定制角色、口音和声音特征——按照 Google 的示例,既可以让一条戏剧性的喷火巨龙栩栩如生,也可以打造一位带有鲜明地域韵律的魅力叙述者。与文章一同发布的演示片段展示了模型生成墨尔本高能量 DJ 声音、极细的单调机器人声音以及一条日本龙的声音。
丰富的声音库。 平台提供 2,000 多个可用于生产环境的声音,语言覆盖广泛,包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
声音复刻。 用户只需 30 秒的本人声音或有权使用的声音音频样本,即可重建一致的声纹特征。该功能由内置的同意验证、SynthID 水印和 C2PA 凭证——一项记录媒体来源和生产方式内容的开放行业标准——提供保障,以保护开发者及其配音人才。
保存与扩展。 定制声音可被保存和管理,以确保在长期项目中保持一致表现并将漂移降至最低。
声音混音。 即将推出:用户可以从声音库中选择一个声音,微调其音色、音高、语速和口音,并通过提示词调整特征,例如"添加轻微的美式南方口音"或"让语气更柔和"。
逐行导演表演
选定声音后,两款 TTS 模型都让用户对每一句台词的演绎方式进行精确控制。用户可以编写自己的舞台指示,或让 Gemini 通过自然的剧本提示来引导演绎——从沉稳的客服代理到低声细语的悬疑场景。Google 的演示展示了模型为交互式语音代理提供自然且极具表现力的对话,以及通过精细的剧本控制构建极具吸引力的沉浸式音频体验和具有自然对话轮替的完整对话场景。
其他表演功能包括:
长篇生成。 模型可在数小时连续音频中保持高语音质量、自然节奏和角色音色,且说话人漂移极小,Google 将其定位为播客和有声书的理想选择。
原生双说话人场景调度。 多轮对话可以通过单个剧本无缝调度——无论用于播客还是戏剧性叙事——同时保持两个声音清晰分离,并实现自然的对话轮替。
脚本化的语气爆发与接话反馈。 通过 <laughs>、<sigh> 和 <gasp> 等非语言提示,以及 |mhm| 或 |yeah| 等积极倾听的插话,为内容增添逼真的对话质感,实现精确的喜剧时机把握和反应节奏。
基准测试与多语言覆盖
Google 报告称,Gemini 3.8 Flash TTS 在语音定制能力上处于领先地位,以 71.4 的得分在 Hume AI 的 Voice Design Benchmark——这家专注语音的 AI 研究公司 Hume AI 的第三方评估——中位列总体第一,并以 60.8 的得分在口音建模方面领先。该公司补充道,Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 在不牺牲可靠性的情况下实现了极具表现力的表演,分别在 Hume AI 的整体质量指数上位列第一和第 名。
与 Gemini 3.1 Flash TTS 相比,Google 表示新模型在长篇内容和双说话人剧本控制等广泛用例中均有重大改进。
在 Voice Arena 的盲测人类偏好评估中——即听众在不知道样本出自哪个模型的情况下进行对比——Gemini 3.8 Flash 和 Flash-Lite TTS 在包括日语、巴西葡萄牙语、越南语、现代标准阿拉伯语(MSA)、墨西哥西班牙语和印地语等关键全球语言中均位居竞争对手前列。该公司表示,凭借对 100 多种语言的支持,这些模型使创作者、开发者和企业能够在全球构建高质量的多语言语音体验。
安全、同意与透明
Google 表示,其构建语音创建和复刻功能时采用了严格的安全保障措施,以保护配音人才、尊重身份并确保内容透明。在声音复刻方面,系统采用同意验证机制:用户必须提供与参考说话人相符的、来自声音所有者的口头同意录音,才能创建声音。这些保障措施针对的是生成式音频中最受关注的风险之一:克隆声音被滥用于冒充和欺诈,这也使同意与验证流程成为 AI 政策辩论的焦点。
更广泛地说,Gemini 音频模型生成的每一段音频片段都带有 SynthID 水印——这是 DeepMind 用于识别 AI 生成内容的水印技术。Google 称这种水印不可感知并直接编织在音频输出中,使 AI 生成的语音保持可检测性,以帮助防止虚假信息传播。有关该公司安全与责任方针的更多细节,可查阅 Gemini 3.8 音频模型卡。
Google 还指出了一项地区限制:通过 AI Studio 进行的声音复刻在伊利诺伊州、得克萨斯州、欧洲经济区(EEA)、英国、瑞士和印度不可用。
Google AI Studio 中的声音设计工作区
从今天开始,开发者可以在 Google AI Studio 中体验这些新的语音生成功能。该工具的设计类似于一个声音设计工作区,用户可以从零提示生成全新的声音身份或复刻自己的声音,然后将其直接导入双说话人剧本编辑器,逐行指导演绎。
开发者平台与发布合作伙伴
通过 Gemini API,包括 Agora、LiveKit、Pipecat 和 Vercel 在内的开发者平台——涵盖实时通信基础设施、语音代理框架和部署工具——使开发者能够轻松构建和部署高性能的语音生成体验。
Google 还与 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司合作,这些公司正在集成最新的 TTS 模型,以帮助加速全球配音、利用细腻的地区口音实现媒体本地化,并大规模驱动对话式语音代理。
可用性
两款模型从今天开始陆续推出。
Gemini 3.8 Flash TTS:
- 面向开发者:可在 Gemini API 和 Google AI Studio 中使用。
- 面向企业:即将通过 API 在 Gemini Enterprise 中推出。
- 面向消费者:可在 Gemini Notebook 中使用。
Gemini 3.8 Flash-Lite TTS:
- 面向开发者:可在 Gemini API 和 Google AI Studio 中使用。
- 面向企业:即将通过 API 在 Gemini Enterprise 中推出。
- 面向消费者:可在 Google Vids 中使用。
Google 标记为"即将推出"的功能——声音混音和通过 Gemini Enterprise 的 API 访问——是随着发布范围扩展到今天的发布合作伙伴和早期访问渠道之外而值得关注的下一个里程碑。
随着此次发布,Gemini 音频产品线涵盖了实时翻译和转录、通过 3.8 Live 和 3.8 Live Extended Thinking 进行的实时语音对话,以及如今富有表现力的语音生成,为创作者、开发者和企业提供了一个用于构建语音驱动产品的统一模型家族。