Google DeepMind 推出 Gemini 3.8 Live 與 3.8 Live Extended Thinking 自然語音 AI 模型
重點速覽
- •Google DeepMind 於 2026 年 9 月 15 日推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,並稱其為迄今最先進的即時對話模型。
- •Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 排名整體第一,在 τ-Voice 代理式基準測試中取得 68.6%,在 Big Bench Audio 上取得 97.7%。
- •這些模型能以近即時處理視覺輸入、在對話中自動切換支援的 97 種語言,並在對話持續進行的同時於背景執行工具與 API 呼叫。
- •Gemini 3.8 Live 定位於規模化與成本效益,Extended Thinking 則專為高複雜度任務設計,可同時推理與說話,包括即時進度旁白。
- •兩款模型即日起可透過 Gemini API 與 Google AI Studio 使用,並 Gemini Enterprise、Google Workspace、Search Live 與 Gemini 應用程式進行企業與消費者端部署。

Google DeepMind 於 2026 年 9 月 15 日宣布推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,並稱其為迄今最先進的即時對話模型。根據公告,這兩款模型在近即時推理方面帶來進展,能更有效地支援語音代理,並在智慧能力與平行推理方面大幅升級,使其更直覺易於協作,也更適合以語音執行複雜任務。
本文由首席工程師 Tom Ouyang 與技術部門成員 Malini Jaganathan 代表 Gemini 音訊團隊撰寫。
Google 表示,此次推出旨在使語音互動更加自然、流暢且智慧。新模型能處理複雜推理、即時視覺情境與背景任務執行,而不會中斷進行中的對話。它們可以應對插話、在不同語言之間切換,並在工作過程中說明自己的思考邏輯——Google 將這種行為形容為邁向讓 AI 猶如真正對話夥伴的一步。無論使用者是在解決複雜問題或純粹閒聊,公司表示這種體驗的設計目標是讓人感覺 AI 正在聆聽並與你一同思考。這些功能即日起可透過 Gemini API、Google Workspace 與 Gemini 應用程式使用。
兩款模型針對不同的使用情境:
- Gemini 3.8 Live 專為規模化與成本效益而設計,結合對話智慧、流暢對話與視覺定位能力。
- Gemini 3.8 Live Extended Thinking 專為高複雜度任務而設計,具備更高的智慧與多步驟推理能力。
針對開發者與企業,Google 將這兩款模型定位為打造可靠、可上線的語音代理的基礎元件。公司也表示,它們讓在 Gemini 應用程式、Google Workspace 與 Search 中與 Gemini 對話更加流暢且具協作性,協助使用者僅憑語音即可處理複雜任務。
基準測試與效能
Gemini 3.8 Live Extended Thinking 提供了 Google 所稱的企業級任務完成能力與智慧,以 82.6 分在 Artificial Analysis 的 Speech to Speech Quality Index 奪得整體第一名。該模型在代理式任務完成方面居於領先,在 τ-Voice 上取得 68.6%,在 Sierra 的 τ-Voice-banking 基準測試中取得 35.1%。它也具備強大的推理能力,在 Big Bench Audio 上取得 97.7%,同時與其他前沿模型相比維持極具競爭力的價格。
Gemini 3.8 Live 在使用者中展現出高度偏好,在 Speech Agent Arena 中獲得第二名。除了這項成績之外,Google 表示它仍極具成本效益,為開發者與企業提供一款為規模化而打造、能力強大且高效的模型。
在用於評估語音代理的 ServiceNow EVA-Bench 上,Google 表示其模型透過成功平衡準確度與對話品質,為複雜工作流程推進了 Pareto 前沿。公司指出,該評估是在 Gemini Enterprise Agent Platform 的 Live API 上執行。
視覺情境、97 種語言與背景執行
Gemini 3.8 Live 以近即時方式處理視覺輸入,為對話增添情境以提供更有幫助的回應。它能在對話過程中自動偵測並在支援的 97 種語言之間切換。模型還能在對話持續進行的同時於背景執行工具與 API 呼叫,使其能夠確認請求並持續聊天,同時任務在幕後完成。
公告中發布的影片示範顯示,該模型能即時引導員工入職培訓、運用視覺情境回答即時問題,並結合視覺情境、推理與自然的對話流程,以近即時方式下西洋棋。
邊推理邊說話
對於需要更深層推理的任務,Gemini 3.8 Live Extended Thinking 能同時進行推理與說話。Google 表示,該模型在為複雜工作流程提供更高智慧的同時,維持不中斷的對話流程。它會使用如「讓我確認一下……」等早期語音提示來自然地回應請求,並提供即時進度旁白,引導使用者了解多步驟背景任務的進展。
示範內容包括 Gemini 3.8 Live Extended Thinking 將原始草圖與近即時語音回饋轉換為可運作的 React 元件,以及在不中斷自然即時對話的情況下協調多步驟預訂與非同步函式呼叫。Google 也展示了 Gemini 3.8 Live 透過自然語音即時建立完整的商業計畫與客製化行銷工具包。
Google Workspace 與 Search 整合
在 Google Workspace 與 Search 中,Live 系列模型旨在提供更直覺、更具協作性的體驗,尤其是在處理最複雜的任務時。ini 3.8 Live Extended Thinking 可透過 Docs Live、Gmail Live 與 Keep Live 在 Google Workspace 中使用。Search Live 則提供由 Gemini 3.8 Live 驅動的逐步即時疑難排解協助。
開發者與企業語音生態系統
透過 Gemini Live API,包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 在內的開發者平台,讓開發者能輕鬆建置與部署高效能的語音驅動介面。這些平台在幕後管理複雜的即時媒體串流基礎架構,讓開發者能夠完全專注於打造使用者體驗。
Google 並補充,公司正與 Salesforce、Genspark 與 Lumeris 等企業合作,這些公司對 3.8 Live 與 3.8 Live Extended Thinking 感到興奮,並強調其出色的延遲表現、流暢度與工具呼叫能力。
以 SynthID 浮水印確保透明度
Google AI 產品所生成的所有音訊均帶有 SynthID 浮水印。公司表示,這種不可察覺的浮水印直接編織在音訊輸出中,確保 AI 生成的內容仍可被偵測,以協助防範錯誤資訊。有關公司在安全與責任方面的做法,Google 請讀者參閱模型卡。
開始使用我們最新的 Gemini 音訊模型:
兩款模型即日起於開發者、企業與消費者端陸續推出。
Gemini 3.8 Live:
- 開發者:於 Gemini API 與 Google AI Studio。
- 企業:於 Gemini Enterprise 私人預覽,即將登陸 Gemini Enterprise for Customer Experience。
- 一般使用者:於 Search Live。
Gemini 3.8 Live Extended Thinking:
- 開發者:於 Gemini API 與 Google AI Studio。
- 企業:於 Gemini Enterprise 私人預覽,即將登陸 Gemini Enterprise for Customer Experience 與 Google Workspace 商業客戶。
- 一般使用者:於 Gemini Live,Workspace 中的 Google AI Pro 與 Ultra 訂閱者可在 Docs 使用,所有 Google AI 訂閱者可在 Gmail 與 Keep 使用。
完整公告(包括影片示範)可於 Google DeepMind 部落格查閱。