新聞股票Google DeepMind 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS,迄今最具表現力的文字轉語音模型

Google DeepMind 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS,迄今最具表現力的文字轉語音模型

作者: Google DeepMind Blog·

重點速覽

  • Google DeepMind 推出兩款文字轉語音模型:專為表現力角色設計與場景指導打造的 Gemini 3.8 Flash TTS,以及專為大量、具成本效益語音生成打造的 Gemini 3.8 Flash-Lite TTS。
  • 使用者可透過自然語言提示設計原創聲音,從涵蓋超過100種語言與方言、超過2,000種可用於正式生產的聲音庫中選擇,並可從30秒音訊樣本複製聲音。
  • 兩款模型皆提供逐行控制節奏、情緒、非語言提示與雙人場景編排的能力,並能在說話者漂移極小的情況下生成數小時的連續音訊。
  • Google 表示,Gemini 3.8 Flash TTS 以71.4分在 Hume AI 的聲音設計基準測試中奪得第一,且兩款模型在 Hume AI 的整體品質指數上包辦前兩名。
  • 聲音複製須經聲音所有者的同意驗證,所有生成的音訊均帶有 SynthID 浮水印,且透過 AI Studio 進行的聲音複製在伊利諾州、德州、歐洲經濟區(EEA)、英國、瑞士與印度等地區不提供。
Google DeepMind 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS,迄今最具表現力的文字轉語音模型

Google DeepMind 於2026年9月23日宣布發布 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,兩款被公司稱為迄今最具表現力的音訊生成模型。這些模型可生成自訂角色聲音與完整指導的場景對話,並正在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 與 Google Vids 上陸續推出。文字轉語音已成為生成式 AI 中快速發展的領域,有聲書製作、遊戲、配音與即時語音代理都推動了對聽起來逼真的人聲合成技術的需求。

這項公告發表於 Google DeepMind 部落格,由 Gemini 音訊團隊的集團產品經理 Leland Rechis 與研究科學總監 Alan Cowen 撰寫。

Google 在摘要中表示,使用者可以透過簡單的自然語言提示從零建立自訂聲音或複製現有聲音,逐行指導音訊以控制節奏、情緒,甚至逼真的對話音效,並將模型用於高品質的有聲書、播客或大規模即時語音代理。模型內建浮水印等安全工具,協助保障生成的音訊安全。

兩款模型對應不同工作負載

Google 將此次發布形容為將語音生成「從靜態預設轉變為動態的創意工作室」,讓創作者、開發者與企業能打造更豐富、更具表現力的音訊體驗。公司補充,這些模型也改善了自家產品(包括 Gemini Notebook 與 Google Vids)的使用者體驗。

Gemini 3.8 Flash TTS 專為深度創作指導與角色設計而打造。它可以透過自然語言提示從零建立全新的聲音,為遊戲、沉浸式有聲書、播客與互動媒體中的角色注入生命。使用者可以逐行指導每次表演,表演提示、節奏、方言切換與附和應答進行細緻控制。

Gemini 3.8 Flash-Lite TTS 則專為大量、具成本效益的規模化應用而設計。Google 表示,它針對大量配音、音訊內容創作與富有表現力的語音代理進行最佳化,可對語調、節奏與表現細節進行精細控制。Flash 與 Flash-Lite 的區分遵循 Google 在 Gemini 家族中已採用的命名慣例,Lite 變體作為更輕量、以成本為導向的選項,服務高吞吐量工作負載。

這兩款模型補充了快速成長的 Gemini 音訊家族,此前已包括 3.5 Live Translate、3.5 Transcribe、3.8 Live 與 3.8 Live Extended Thinking。

建立並自訂專屬聲音

透過新模型,Google 將原本的30種原始聲音擴展至其所稱的無限聲音庫。無論目標是完全原創的角色聲音,還是一致的品牌代言聲音,公司表示 Gemini 3.8 Flash TTS 提供完整的聲音工作室功能,讓使用者能為每個時刻建立並部署富有表現力、聽起來自然的聲音,同時開發者與企業也能在此基礎上打造客製化音訊體驗。

今日公布的聲音建立功能包括:

生成式聲音設計。 使用者可透過 Gemini 3.8 Flash TTS 以自然語言提示從零打造客製化聲音,在超過100種語言與方言中自訂角色、口音與聲音特徵——無論是 Google 範例中賦予戲劇性、噴火的龍生命,還是塑造帶有鮮明地域韻律的魅力旁白。與文章一同發布的示範影片展示模型生成墨爾本的高能量 DJ 聲音、極細緻單調的機器人聲音,以及一條日本龍的聲音。

龐大的聲音庫。 平台提供超過2,000種可用於正式生產的聲音,涵蓋廣泛的語言,包括墨西哥西班牙語、魁北克法語與蘇格蘭英語等地區變體。

聲音複製。 使用者可從自己聲音或擁有使用權限的聲音的30秒音訊樣本中重建一致的聲音特徵。此功能由內建同意驗證、SynthID 浮水印與 C2PA 憑證——一項用於記錄媒體來源與製作方式的開放產業標準——支援,以保護開發者及其配音人才。

儲存與擴展。 自訂聲音可儲存與管理,以確保進行中的專案保持一致的表現並少漂移。

聲音混音。 即將推出,使用者可從聲音庫中選擇聲音並微調音色、音高、語速與口音,透過提示調整特徵,例如「加入輕微的美國南方口音」或「讓語氣更柔和」。

逐行指導表演

選定聲音後,兩款 TTS 模型都讓使用者能精確控制每句台詞的呈現方式。使用者可以撰寫自己的舞台指示,或讓 Gemini 透過自然的劇本提示引導表演——從沉著的客服人員到耳語般的懸疑場景。Google 的示範展示模型為互動語音代理提供自然且極具表現力的對話,以及透過細緻的劇本控制打造深度沉浸的音訊體驗與自然輪替的完整對話場景。

其他表演功能包括:

長篇生成。 模型可在數小時的連續音訊中保持高語音品質、自然節奏與角色音色,且說話者漂移極小,Google 將其定位為播客與有聲書的理想選擇。

原生雙人場景編排。 多輪對話可從單一劇本無縫指導——無論是播客還是戲劇敘事——同時保持兩個聲音明顯區分並具自然的對話輪替。

腳本化的語音爆發與附和應答。<laughs><sigh><gasp> 等非語言提示,加上 |mhm||yeah| 等積極聆聽的插話,為精確的喜劇時機與反應節奏增添逼真的對話質感。

基準測試與多語言覆蓋

Google 表示,Gemini 3.8 Flash TTS 提供領先的聲音自訂能力,在語音 AI 研究公司 Hume AI 的第三方評測 Hume AI's Voice Design Benchmark 上以71.4分奪得總排名第一,並以60.8分在口音建模上領先。公司補充,Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 在不犧牲可靠性的前提下實現富有表現力的表演,分別在 Hume AI 的整體品質指數上位居第一與第二。

Google 表示,與 Gemini 3.1 Flash TTS 相比,新模型在廣泛的使用情境上展現重大改進,包括長篇內容與雙人劇本控制。

在 Voice Arena 的盲測人類偏好評估中——聽眾在不知哪款模型生成的情況下比較匿名樣本——Gemini 3.8 Flash 與 Flash-Lite TTS 在包括日語、巴西葡萄牙語、越南語、現代標準阿拉伯語(MSA)、墨西哥西班牙語與印地語等關鍵全球語言中名列前茅。公司表示,憑藉對超過100種語言的支援,這些模型讓創作者、開發者與企業能夠在全球範圍內打造高品質語言語音體驗。

安全、同意與透明

Google 表示,聲音建立與複製功能是在嚴格的保障措施下構建的,以保護配音人才、尊重身分並確保內容透明。對於聲音複製,系統採用同意驗證:在建立聲音之前,使用者必須提供與參考說話者相符的聲音所有者口頭同意錄音。這些保障措施回應了生成式音訊中最受關注的風險之一:克隆聲音被濫用於冒充與詐騙,這使得同意與驗證流程成為 AI 政策辯論的焦點。

更廣泛而言,Gemini 音訊模型生成的每段音訊都帶有 SynthID 浮水印,這是 DeepMind 用於識別 AI 生成內容的浮水印技術。Google 描述這種浮水印不可察覺並直接編織在音訊輸出中,使 AI 生成的語音保持可偵測性,以協助防止錯誤資訊。有關公司安全與責任方法的更多細節,請參閱 Gemini 3.8 音訊模型卡

Google 也指出一項地區限制:透過 AI Studio 進行聲音複製在伊利諾州、德州、歐洲經濟區(EEA)、英國、瑞士與印度不提供。

Google AI Studio 中的聲音設計工作區

從今日起,開發者可以在 Google AI Studio 中試用這些新的語音生成功能。這款工具的設計如同聲音設計工作區,使用者可以從零提示全新的聲音身分或複製自己的聲音,然後將這些聲音直接帶入雙人劇本編輯器中進行逐行表演指導。

開發者平台與發布夥伴

透過 Gemini API,Agora、LiveKit、Pipecat 與 Vercel 等開發者平台——涵蓋即時通訊基礎設施、語音代理框架與部署工具——讓開發者能輕鬆構建與部署高效能的語音生成體驗。

Google 也與 Figma、HeyGen、Linguana、Wondercraft、99.co 與 Ollang 等公司合作,這些公司正在整合最新的 TTS 模型,以協助加速全球配音、以細膩的地區口音進行媒體在地化,並大規模驅動對話式語音代理。

可用性

兩款模型自今日起陸續推出。

Gemini 3.8 Flash TTS:

  • 開發者:可透過 Gemini API 與 Google AI Studio 使用。
  • 企業:即將透過 Gemini Enterprise 的 API 提供。
  • 一般使用者:可透過 Gemini Notebook 使用。

Gemini 3.8 Flash-Lite TTS:

  • 開發者:可透過 Gemini API 與 Google AI Studio 使用。
  • 企業:即將透過 Gemini Enterprise 的 API 提供。
  • 一般使用者:可透過 Google Vids 使用。

Google 標記為即將推出的功能——聲音混音與透過 Gemini Enterprise 的 API 存取——是隨著推廣範圍超越今日的發布夥伴與早期存取點後,值得關注的下一個里程碑。

隨著這次發布,Gemini 音訊產品線涵蓋即時翻譯與轉錄、透過 3.8 Live 與 3.8 Live Extended Thinking 的即時語音對話,以及現在的富表現力語音生成,為創作者、開發者與企業提供一個用於構建語音驅動產品的單一模型家族。