新闻股票Google DeepMind 推出用于实时语音转文字的 Gemini 3.5 Transcribe

Google DeepMind 推出用于实时语音转文字的 Gemini 3.5 Transcribe

作者: Google DeepMind Blog·

要点速览

  • Google 表示,Gemini 3.5 Transcribe 是其迄今最精确的语音转文字模型,面向语音驱动工作流设计。
  • 该模型通过 Live API 提供实时流式转录,并通过 Interactions API 提供带说话人归属和时间戳的录音转写。
  • Google 表示,该模型支持 85 种以上语言、自定义词汇、实时语言切换,以及在预录音频中最多三位说话人的识别。
  • 公司称,与 Chirp 3 相比,Gemini 3.5 Transcribe 在延迟和词错误率方面均有提升,最终转录时间缩短了 70%。
  • Google 表示,该模型已面向开发者、企业和消费者以公测形式开放,覆盖 macOS 版 Gemini app 和 Android 版 Rambler 等 Google 产品。
Google DeepMind 推出用于实时语音转文字的 Gemini 3.5 Transcribe

Google DeepMind 推出用于实时语音转文字的 Gemini 3.5 Transcribe

2026 年 8 月 26 日

Gemini Audio 工程高级总监 Diego Melendo Casado 以及 Gemini Audio 首席幕僚 Luke Leonhard 代表 Gemini Audio 团队表示,Google 正在推出 Gemini 3.5 Transcribe,这是公司迄今最精确的语音转文字模型,专为智能语音交互而设计。

据公司介绍,Gemini 3.5 Transcribe 与传统语音识别系统不同,后者往往会在背景噪音、复杂术语和语句不流畅清理方面遇到困难。Google 表示,该模型可将原始音频直接转换为准确、经过润色且格式化的文本,这对需要在不进行大量后处理的情况下获得可用输出的语音工具团队尤为重要。

Google 表示,消费者已经在 Gemini app 和 Android 等产品中使用这款转录模型,包括 Android 上的 Rambler 以及 macOS 版 Gemini app 中的新语音功能。开发者现在也可以通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,使用 Gemini 3.5 Transcribe 构建类似能力。

该模型旨在融入语音代理、实时字幕工具和通话后分析流水线等工作流中,在这些场景中,延迟、格式和说话人归属会影响转录被转化为行动的速度。Google 表示,该模型通过两个独立 API 提供:

  • 实时流式传输: 通过 Live API 使用 gemini-3.5-transcribe-live,为交互式语音应用提供持续、双向流式传输,延迟低于一秒。
  • 预录音频处理: 通过 Interactions API 使用 gemini-3.5-transcribe,为录制音频、会议、通话记录等内容提供转录,并包含说话人归属和逐词时间戳。

功能与性能

Google 表示,Gemini 3.5 Transcribe 旨在捕捉自然说话风格,更好理解用户意图并识别自定义词汇,使用户能够通过语音执行任务。

公司强调了以下几项能力:

  • 智能转录: 可无缝处理自我修正,例如“let’s meet Tuesday—no, Wednesday”,并移除填充词,如“ums”和“ahs”,同时自动格式化文本。
  • 函数调用: 可通过函数调用将图像生成和文件分析等复杂任务委派给其他 Gemini 模型。Google 表示,该功能目前已在 Gemini macOS app 中提供。
  • 更精确的转录: 根据 Artificial Analysis 的测量,该模型在流式场景中的平均 Word Error Rate(WER)为 4.0%,在非流式场景中的平均 WER 为 2.6%。Google 表示,该模型在嘈杂的真实环境中表现强劲,并能准确捕捉邮政编码和订单 ID 等字母数字实体。
  • 自定义词汇: 通过无缝适配用户提供的自定义词汇,识别专业术语和独特拼写。
  • 全球语言支持: 可自动检测并转录 85 种以上语言,能够顺畅处理地区口音和多样方言。
  • 多说话人识别: 在预录音频中,可为最多三位说话人准确标注带时间戳的语音归属;对 3 人以上的支持仍处于实验阶段。

Google 表示,Gemini 3.5 Transcribe 能处理实时语言切换和无缝流式转录。公司还称,与此前的转录模型 Chirp 3 相比,该模型代表了重大进步,提供了新能力、更好的词错误率以及显著更低的延迟。根据 Artificial Analysis 的测量,最终转录所需时间提升了 70%。在涵盖一组顶级语言和地区的 FLEURS 基准测试中,Google 表示该模型在流式模式下实现了 5.50% 的 WER,在非流式场景中实现了 5.04% 的 WER。

跨 Google 产品的智能转录

Google 表示,Gemini 3.5 Transcribe 不仅限于标准语音转文字,还通过在 Gboard、Antigravity、Gemini app 和 Chrome 等场景中引入具备上下文感知的理解,让在 Google 生态中的工作更自然、更直观。

在 Android 版 Gboard 上,新的 Rambler 功能使用 Gemini 3.5 Transcribe 将口述内容转换为格式化文本,同时过滤填充词。用户还可以使用语音进行编辑、纠正拼写错误并更改写作风格。

在 Google Antigravity 中,模型会在用户授权下结合屏幕上下文和聊天历史,以提升文件名、代理思考内容和活动文档中的转录准确性。

在 Google AI Studio 中,用户可以在 Build 模式下访问 Gemini 3.5 Transcribe,通过语音输入即时创建应用。

在 macOS 版 Gemini app 中,该模型不仅可将自然口语转录为整洁的格式化文本,还支持语音命令,并可与屏幕上下文无缝结合以支持更复杂的工作流。Google 表示,该模型会在后台调用其他 Gemini 模型来处理繁重任务,仅凭语音即可轻松总结本地文件、跨应用改写文本,或在光标处生成图像。

Chrome 支持即将上线,届时用户可以在任何网页输入字段中通过说话输入内容,更自然、更轻松地口述回复、起草帖子,或在 Chrome 中提示 Gemini。

Google 还表示,该模型可仅凭语音在 macOS 版 Gemini app 中分析文件、生成图像并进行搜索。

早期评价与生态支持

Google 表示,包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 在内的开发者平台,正在利用 Gemini Live API 构建和部署语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,使开发者能够将全部精力放在用户体验设计上,这也有助于缩短从模型接入到生产级语音应用上线的路径。

公司还表示,Vivo、Intellitek Health 和 Lingopal 已就 Gemini 3.5 Transcribe 分享了积极反馈,强调其低延迟、高准确率和广泛的语言支持。

可用性

Google 表示,Gemini 3.5 Transcribe 目前以公测形式提供:

  • 面向开发者: 可通过 Google AI Studio 和 Google Antigravity 中的 Gemini API 使用。
  • 面向企业: 可通过 Gemini Enterprise Agent Platform 使用,并即将登陆 Gemini Enterprise for Customer Experience。
  • 面向所有用户: macOS 版 Gemini app 提供英文支持,Android 版 Rambler 在部分国家和语言中提供,Chrome 支持也即将推出。