新闻股票Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking,迈向自然语音 AI

Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking,迈向自然语音 AI

作者: Google DeepMind Blog·

要点速览

  • Google DeepMind 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,称其为迄今最先进的对话模型。
  • Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音到语音质量指数上总体排名第一,在 τ-Voice 代理式基准上得分 68.6%,在 Big Bench Audio 上得分 97.7%。
  • 两款模型以近实时方式处理视觉输入,可在对话中于 97 种支持语言之间自动切换,并在对话继续的同时在后台执行工具和 API 调用。
  • Gemini 3.8 Live 定位于规模化与成本效率,而 Extended Thinking 面向高复杂度任务,可同时推理和说话,并提供实时进度解说。
  • 两款模型即日起通过 Gemini API 和 Google AI Studio 提供,并将在 Gemini Enterprise、Google Workspace、Search Live 和 Gemini 应用中进行企业与消费端推广。
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking,迈向自然语音 AI

Google DeepMind 于 2026 年 9 月 15 日宣布推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,公司称其为迄今最先进的实时对话模型。根据公告,这两款模型在近实时推理方面实现进展,以更有效地支持语音代理,并在智能水平与并行推理方面进行重大升级,使其更易于协作,并更适合通过语音执行复杂任务。

本文由首席工程师 Tom Ouyang 与技术团队成员 Malini Jaganathan 代表 Gemini 音频团队撰写。

Google 表示,此次发布旨在让语音交互更自然、更流畅、更智能。新模型能够处理复杂推理、实时视觉上下文和后台任务执行,且不会打断正在进行的对话。它们可以应对打断、在语言之间切换,并在工作时解释自己的思考过程——Google 将这种行为视为迈向像真实对话伙伴一样的 AI 的一步。无论是解决复杂问题还是简单闲聊,公司表示这一体验的设计目标是让人感觉 AI 正在倾听并与你一同思考。这些功能即日起可通过 Gemini API、Google Workspace 和 Gemini 应用使用。

两款模型面向不同的使用场景:

  • Gemini 3.8 Live 面向规模化与成本效率构建,将对话智能与流畅对话及视觉定位相结合。
  • Gemini 3.8 Live Extended Thinking 面向高复杂度任务构建,具备更强的智能水平和多步骤推理能力。

对于开发者和企业,Google 将这两款模型定位为构建可靠、可投产的语音代理的基础组件。公司还表示,它们让在 Gemini 应用、Google Workspace 和 Search 中与 Gemini 对话更加流畅和协作,帮助用户仅凭语音即可完成复杂任务。

更流畅、更智能的对话体验

Gemini 3.8 Live Extended Thinking 提供 Google 所描述的企业级任务完成能力与智能水平,在 Artificial Analysis 语音到语音质量指数上以 82.6 分夺得总体第一名。该模型在代理式任务完成方面领先,在 τ-Voice 上取得 68.6%,在 Sierra 的 τ-Voice-banking 基准上取得 35.1%。它还具备强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时相比其他前沿模型保持了极具竞争力的价格。

Gemini 3.8 Live 在用户中显示出较高的偏好度,在 Speech Agent Arena 中获得第二名。除这一成绩外,Google 表示它仍具有很高的成本效益,为开发者和企业提供了一款为规模化而构建的高能力、高效率模型。

在用于评估语音代理的 ServiceNow EVA-Bench 基准上,Google 表示其模型通过成功准确性与对话质量,在复杂工作流方面推进了帕累托前沿。公司指出,该评估是在 Gemini Enterprise Agent Platform 的 Live API 上运行的。

视觉上下文、97 种语言与后台执行

Gemini 3.8 Live 以近实时方式处理视觉输入,通过上下文丰富对话,以提供更有帮助的回复。它可在对话进行中自动检测并在其支持的 97 种语言之间切换。该模型还能在对话继续的同时在后台执行工具调用和 API 调用,使其能够确认请求并继续聊天,同时任务在后台完成。

随公告发布的视频演示显示,该模型实时指导员工入职培训、利用视觉上下文回答现场提问,并结合视觉上下文、推理和自然的对话流以近实时方式下国际象棋。

边推理边说话

对于需要更深层次推理的任务,Gemini 3.8 Live Extended Thinking 可同时进行推理和说话。Google 表示,该模型在保持不间断对话流的同时,为复杂工作流提供更强的智能。它使用诸如“让我查一下……”之类的早期口头提示来自然地确认请求,并通过实时进度解说在多步骤后台任务推进时引导用户完成。

演示内容包括 Gemini 3.8 Live Extended Thinking 将原始草图和近实时语音反馈转化为可用的 React 组件,以及在不打断自然实时对话的情况下协调多步骤预订和异步函数调用。Google 还展示了 Gemini 3.8 Live 通过自然语音即时构建完整的商业计划和定制营销工具包。

Google Workspace 与 Search 集成

在 Google Workspace 和 Search 中,Live 模型旨在提供更直观、更协作的体验,尤其是在处理最复杂的任务时。Gemini 3.8 Live Extended Thinking 可通过 Docs Live、Gmail Live 和 Keep Live 在 Google Workspace 中使用。Search Live 则提供由 Gemini 3.8 Live 驱动的分步实时故障排除帮助。

开发者与企业语音生态

借助 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者能够完全专注于打造用户体验。

Google 还补充说,公司正与 Salesforce、Genspark 和 Lumeris 等企业合作,这些企业对 3.8 Live 和 3.8 Live Extended Thinking 感到兴奋,并强调了模型出色的延迟、流畅性和工具调用能力。

通过 SynthID 水印确保透明度

Google AI 产品生成的所有音频均带有 SynthID 水印。公司表示,这种不可感知的水印直接融入音频输出中,确保 AI 生成的内容保持可检测性,以帮助防止错误信息。有关公司在安全与责任方面的做法的详细信息,Google 引导读者查阅模型卡

开始使用最新的 Gemini 音频模型:

两款模型即日起在开发者、企业和消费端陆续上线。

Gemini 3.8 Live:

  • 开发者:在 Gemini API 和 Google AI Studio 中。
  • 企业:在 Gemini Enterprise 中进行私密预览,即将登陆面向客户体验的 Gemini Enterprise。
  • 所有人:在 Search Live 中。

Gemini 3.8 Live Extended Thinking:

  • 开发者:在 Gemini API 和 Google AI Studio 中。
  • 企业:在 Gemini Enterprise 中进行私密预览,即将登陆面向客户体验的 Gemini Enterprise 以及 Google Workspace 企业客户。
  • 所有人:在 Gemini Live 中;Workspace 中订阅 Google AI Pro 和 Ultra 的用户可在 Docs 中使用,所有 Google AI 订阅者可在 Gmail 和 Keep 中使用。

包含视频演示的完整公告可在 Google DeepMind 博客上查看。