Google DeepMind 推出 Gemini 3.5 Transcribe,支援即時語音轉文字
重點速覽
- •Google 表示,Gemini 3.5 Transcribe 是目前最精準的語音轉文字模型,並針對語音驅動工作流程設計。
- •該模型透過 Live API 提供即時串流轉錄,並透過 Interactions API 提供含說話者標註與時間戳的錄音處理。
- •Google 表示,該模型支援 85 種以上語言、自訂詞彙、即時語言切換,以及預錄音訊中最多三位說話者的識別。
- •公司指出,Gemini 3.5 Transcribe 相較於 Chirp 3 在延遲與字錯率上都有改善,其中完成最終轉錄的時間快了 70%。
- •Google 表示,這款模型已在多項 Google 產品中提供公開預覽,供開發者、企業與一般使用者使用,包括 macOS 版 Gemini app 與 Android 版 Rambler。

Google DeepMind 推出 Gemini 3.5 Transcribe,支援即時語音轉文字
2026 年 8 月 26 日
Gemini Audio 工程資深總監 Diego Melendo Casado 與 Gemini Audio 幕僚長 Luke Leonhard 代表 Gemini Audio 團隊表示,Google 正推出 Gemini 3.5 Transcribe,這是目前最精準的語音轉文字模型,專為智慧語音互動而設計。
根據公司說法,Gemini 3.5 Transcribe 有別於傳統語音辨識系統,後者往往難以處理背景噪音、複雜術語與口語不流暢內容的清理。Google 表示,該模型可將原始音訊直接轉換為準確、精緻且格式化的文字,這對於需要可直接使用輸出的語音工具團隊來說相當重要,因為可減少大量後處理工作。
Google 表示,消費者已經在 Gemini app 與 Android 等產品中使用這項轉錄模型,包括 Android 上的 Rambler,以及 macOS 版 Gemini app 中的新語音功能。現在,開發者可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API,使用 Gemini 3.5 Transcribe 建立類似功能。
這款模型設計可無縫整合進語音代理、即時字幕工具與通話後分析流程等工作,因為在這些場景中,延遲、格式化與說話者標註都會影響轉錄結果轉化為行動的速度。Google 表示,它透過兩個獨立 API 提供:
- 即時串流: 透過 Live API 使用
gemini-3.5-transcribe-live,為互動式語音應用提供連續、雙向串流,延遲低於一秒。 - 預錄音訊處理: 透過 Interactions API 使用
gemini-3.5-transcribe,可轉錄錄音、會議、通話紀錄等內容,並提供說話者標註與逐字時間戳。
更精準且更智慧的轉錄
Google 表示,Gemini 3.5 Transcribe 的設計目標是捕捉自然說話風格,更好理解使用者意圖並辨識自訂詞彙,讓使用者能以語音執行任務。
公司列舉了多項能力:
- 智慧轉錄: 可順暢處理自我修正,例如「let’s meet Tuesday—no, Wednesday」,移除填充詞,例如 “ums” 和 “ahs”,並自動格式化文字。
- 函式呼叫: 可透過 function calls 將影像生成、檔案分析等複雜任務委派給其他 Gemini 模型。Google 表示,這項功能目前可在 Gemini macOS app 中使用。
- 更精準的轉錄: 根據 Artificial Analysis 的測量,該模型在串流情境的平均 Word Error Rate(WER)為 4.0%,非串流情境為 2.6%。Google 表示,它在嘈雜的真實世界環境中表現強勁,並能準確辨識郵遞區號與訂單 ID 等字母數字混合內容。
- 自訂詞彙: 能依據使用者提供的自訂詞彙,無縫調整轉錄內容,以辨識專業術語與特殊拼寫。
- 全球語言支援: 可自動偵測並轉錄 85 種以上語言,並能順暢處理區域口音與多樣方言。
- 多說話者識別: 在預錄音訊中,可為最多三位說話者標註時間戳並正確歸屬語音內容(支援 3 位以上說話者屬於實驗性功能)。
Google 表示,Gemini 3.5 Transcribe 能處理即時語言切換與無縫串流轉錄。公司也指出,這款模型相較於先前的轉錄模型 Chirp 3 有重大進展,具備新功能、更好的字錯率與顯著更低的延遲。根據 Artificial Analysis 的測量,完成最終轉錄所需時間例如改善了 70%。在涵蓋多種主要語言與地區的 FLEURS 基準測試中,該模型在串流模式的 WER 為 5.50%,非串流情境則為 5.04%。
在 Google 產品中體驗智慧轉錄
除了在 Google AI Studio 與 Gemini Enterprise Agent Platform 提供 Gemini API 外,3.5 Transcribe 進一步超越標準語音轉文字,讓在 Google 生態系中的操作更自然直覺。透過將具備情境理解的能力直接帶入 Gboard、Antigravity、Gemini app 與 Chrome 等日常介面,它能輕鬆捕捉語意、意圖與行內編輯。
在 Android 版 Gboard 上,透過新的 Rambler 功能,3.5 Transcribe 可將口語想法轉為格式良好的文字,並過濾填充詞。使用者也可以用語音進行編輯、修正拼字與變更寫作風格。
在 Google Antigravity 上,3.5 Transcribe 會結合螢幕內容與聊天紀錄,在使用者授權下,提升檔案名稱、代理人思考內容與使用中文件的轉錄準確度。
在 Google AI Studio 中,使用者可以在 Build mode 存取 3.5 Transcribe,透過語音即時打造應用程式。
在 macOS 版 Gemini app 中,3.5 Transcribe 不僅能將自然口語轉為乾淨、格式化的文字,也支援可與螢幕內容無縫配合的語音指令,以驅動更複雜的工作流程。透過在背景呼叫其他 Gemini 模型處理較重的工作,這款模型可輕鬆總結本機檔案、在不同應用程式間重新運用文字,或直接在游標位置生成影像,全都只需透過語音。
Chrome 即將支援後,使用者將能在任何網頁欄位中以說話輸入,讓以語音 дикation 回覆、撰寫貼文,或在 Chrome 中向 Gemini 提示,都能更自然、更輕鬆地完成。
Gemini 3.5 Transcribe 讓使用者僅透過語音,就能在 macOS 版 Gemini app 中分析檔案、生成影像並進行搜尋。
了解 Gemini 3.5 Transcribe 如何在 Android 版 Rambler 中自動移除填充詞並清理語音。
Gemini 3.5 Transcribe 會運用 Google Antigravity 的螢幕內容,確保轉錄準確無誤。
閱讀初期評價
透過 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 等開發者平台,讓開發者能輕鬆建立與部署高效能的語音驅動介面。這些平台在背景管理複雜的即時媒體串流基礎架構,使開發者能完全專注於打造使用者體驗。
Vivo、Intellitek Health 與 Lingopal 等公司也分享了對 3.5 Transcribe 的正面回饋,強調其延遲、準確度與廣泛的語言支援能力。
立即開始使用 3.5 Transcribe
開發者: 透過 Google AI Studio 與 Google Antigravity 中的 Gemini API,以公開預覽形式提供。
企業: 透過 Gemini Enterprise Agent Platform 以公開預覽形式提供,並即將支援 Gemini Enterprise for Customer Experience。
所有使用者: 於英語版 macOS 的 Gemini app、部分國家與語言版本的 Android 版 Rambler,以及即將在 Chrome 中提供。
在你的信箱中接收 Google 最新消息
訂閱我們的電子報,取得產品更新、活動資訊、特別優惠等更多內容。
完成了。只差一步。
請檢查你的信箱以確認訂閱。
你也可以使用其他電子郵件地址訂閱。
你的資訊將依照 Google 的隱私權政策使用。你可隨時取消訂閱。