Google 推出 Gemini 3.8 Live 音訊模型,迎戰即時對話式 AI
重點速覽
- •Google 於 9 月 15 日推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,這兩款音訊模型專為打造能在即時對話中推理並執行任務的語音代理而設計。
- •這些模型能在串流音訊回應的同時執行 API 與工具呼叫、接收即時視覺輸入,並支援超過 97 種語言。
- •Extended Thinking 版本包含可設定思考功能,讓使用者能開啟或關閉模型的內部推理。
- •該架構將互動延遲與推理延遲分離,讓代理能在背景持續推理的同時保持對話流暢,而非為等待答案而暫停。
- •分析師認為 Google 正在追上 Apple 等廠商,同時推進即時 AI 互動,企業應用包括客戶支援聊天機器人、銷售流程及多模態代理應用。

Google 推出兩款全新音訊模型,讓企業能部署具備更深推理能力、更多互動性與對話速度的智慧 AI 代理。
Google 表示,Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 於 9 月 15 日推出,讓開發者能打造可在維持對話流暢的同時進行推理並執行任務的語音代理。這些模型支援跳脫傳統提示—回應架構的即時互動,讓使用者能自然對話,而非發出一則則離散的提示。
這些模型的關鍵能力包括:在使用者持續接收串流音訊回應的同時執行 API 與工具呼叫(即代理連接外部系統並執行任務的機制)、接收即時視覺輸入以協助代理理解使用者所說的內容與所見的畫面,以及支援超過 97 種語言——對於跨區域部署語音代理的企業而言極具意義。Extended Thinking 版本新增可設定思考(configurable thinking)功能,讓使用者能開啟或關閉 AI 模型的內部推理。
此次發表距離 Google 首次推出 Gemini 3.8 Flash 與 3.8 Cyber 基礎模型僅兩週。
Futurum Group 分析師 Bradley Shimmin 表示,憑藉 3.8 Live 的能力,Google 似乎正在追上 Apple 等已在 Notes 與 Voice Memos 等生產力應用中提供即時轉錄功能的廠商。不過他也指出,Google 的技術更進一步,改變了使用者與 AI 互動的方式。
真實對話
Shimmin 表示:「從它的架構來看……你可以將它客製化成許多不同的運作方式。」他指出,雖然企業可以將這些模型用於傳統的翻譯用途,但 Google 也將模型設計成讓使用者不以提示—回應的方式與之互動,而是進行真正的對話。
Shimmin 說:「這就像一場自然的對話,而且可以在即時對話中插話補充。你可以在不打斷它正在進行的工作的情況下,將上下文注入對話之中。」
Tekonyx 創辦人 Sid Nag 表示,憑藉 Google 先進的語音技術,這些新模型不會只按照問題的表面意思作答。
Nag 表示:「這個模型是為背景推理而設計的。它會在對話過程中進行推理,因此在推理的同時對話仍能持續進行。」
這項技術的進展之處在於,將互動延遲(使用者執行動作到系統回應之間的延遲)與推理延遲(AI 模型處理資訊所需的總時間)分離開來。這種分離,讓代理能在背景持續推理的同時保持對話流暢,而非暫停互動直到答案就緒。
Nag 表示:「它是即時進行推理,而不是停下來之後才回覆另一個答案。」
Nag 繼續說道,這些語音模型也改變了 AI 代理回應與互動的方式,因為「AI 代理不必再於反應快速與深思熟慮之間做取捨。它其實可以維持即時的互動。」
Nag 表示,這些新模型的企業應用包括客戶支援聊天機器人、銷售流程,以及結合文字、語音與影片的多模態代理應用。代理應用是指由 AI 代理進行推理並執行任務,而非僅單純回應提示的軟體——這種模式仰賴的正是新模型所提供的對話中工具呼叫與背景推理能力。
AI Business 的 Esther Shittu 報導。原文報導:Gemini 3.8 Live Transforms Conversational AI,發表於 2026 年 9 月 17 日。