Google 推出 Gemini 3.8 Live 音频模型,助力实时对话式 AI
要点速览
- •Google 于 9 月 15 日发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款音频模型,专为构建能在实时对话中推理并执行任务的语音智能体而设计。
- •这些模型可以在流式传输音频响应的同时执行 API 和工具调用,接受实时视觉输入,并支持超过 97 种语言。
- •Extended Thinking 版本包含可配置思考功能,用户可以开启或关闭模型的内部推理。
- •该架构将交互延迟与推理延迟分离,使智能体能够在后台推理持续进行的同时保持对话推进,而无需暂停等待答案。
- •分析人士认为 Google 正在追赶 Apple 等厂商,同时推进实时 AI 交互,其企业应用包括客户支持聊天机器人、销售流程和多模态智能体应用。

Google 推出了两款新的音频模型,使企业能够部署具备更强推理深度、更高交互性和对话速度的智能 AI 智能体。
Google 表示,Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 于 9 月 15 日发布,让开发者能够构建既能推理又能执行任务、同时保持对话流畅进行的语音智能体。这些模型支持无需传统提示-响应结构的实时交互,用户可以进行自然对话,而不是发出一条条独立的提示。
这些模型的关键能力包括:在持续向用户流式传输音频响应的同时执行 API 和工具调用(即智能体连接外部系统并执行任务的机制),接受实时视觉输入以帮助智能体同时理解用户所说和所见的内容,以及支持超过 97 种语言——这一覆盖范围对于跨地区部署语音智能体的企业尤为重要。Extended Thinking 版本增加了可配置思考功能,用户可以开启或关闭 AI 模型的内部推理。
此次发布距离 Google 首次推出 Gemini 3.8 Flash 和 3.8 Cyber 基础模型仅两周。
Futurum Group 分析师 Bradley Shimmin 表示,凭借 3.8 Live 的能力,Google 似乎正在追赶 Apple 等厂商,后者已在 Notes 和 Voice Memos 等生产力应用中提供实时转录。不过他补充说,Google 的技术通过改变用户与 AI 交互的方式,将这一领域提升到了新的层次。
真实的对话
Shimmin 表示:“从其架构方式来看……你可以对其进行定制,让它以很多不同的方式表现。”他指出,虽然企业可以将这些模型用于传统的翻译用例,但 Google 也特意设计了这些模型,使用户不必以提示-响应的方式与之交互,而是可以进行真正的对话。
Shimmin 说:“这就是一场自然的对话,并且能够实时打断并注入内容。你可以在不打断它正在做的事情的情况下,向对话中注入上下文。”
Tekonyx 创始人 Sid Nag 表示,凭借 Google 先进的语音技术,新模型不会只停留在字面上回答问题。
Nag 说:“该模型的设计旨在进行后台推理。它会在对话过程中进行推理,因此在推理的同时对话可以继续进行。”
这项技术是一项进步,它将交互延迟与推理延迟分离开来。交互延迟是用户执行操作到系统做出响应之间的延迟;推理延迟则是 AI 模型处理信息所需的总时间。正是这种分离使智能体能够在后台持续推理保持对话推进,而不是暂停交互等待答案就绪。
Nag 表示:“它是实时进行的,而不是停下来再给出另一个答案。”
他继续说道,语音模型还改变了 AI 智能体响应和交互的方式,因为“AI 智能体不必在快速和深思熟虑之间做出取舍。它实际上可以保持实时交互。”
Nag 表示,新模型的企业应用包括客户支持聊天机器人、销售流程,以及结合文本、语音和视频的多模态智能体应用。智能体应用是指 AI 智能体在其中进行推理并执行任务、而非仅简单响应提示的软件——这种模式依赖于对话中途的工具调用和后台推理,而这正是新模型所提供的能力。
AI Business 记者 Esther Shittu 报道。原报道:Gemini 3.8 Live Transforms Conversational AI,发布于 2026 年 9 月 17 日。