Google DeepMind、これまでで最も表現力豊かな音声生成モデル「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を公開
重要ポイント
- •Google DeepMindは2つのテキスト読み上げモデルを公開した。表現力豊かなキャラクターデザインとシーン演出向けのGemini 3.8 Flash TTSと、大容量かつ低コストの音声生成向けのGemini 3.8 Flash-Lite TTSである。
- •ユーザーは自然言語プロンプトでオリジナルのボイスをデザインし、100以上の言語・方言を網羅する2,000以上のプロダクション対応ボイスのライブラリから選択し、30秒の音声サンプルからボイスを複製できる。
- •両モデルはペース、感情、非言語キュー、2話者シーンステージングを行単位で制御でき、話者ドリフトを最小限に抑え何時間もの連続音声を生成できる。
- •Googleによると、Gemini 3.8 Flash TTSはHume AIのVoice Design Benchmarkで71.4のスコアにより首位を獲得し、2モデルはHume AIのOverall Quality Indexで上位2位を占めた。
- •ボイス複製には声の所有者の確認済み同意が必要で、生成されたすべての音声にはSynthID透かしが付与される。AI Studio経由の複製は、イリノイ州、テキサス州、EEA、英国、スイス、インドなどの地域では利用できない。

Google DeepMindは2026年9月23日、同社がこれまでで最も表現力豊かな音声生成モデルと位置付けるテキスト読み上げ(TTS)モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。両モデルはカスタムキャラクターボイスや、完全に演出されたシーン形式の対話を生成でき、Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsで展開が開始されている。テキスト読み上げは生成AIの中でも急速に発展している分野であり、オーディオブック制作、ゲーム、吹き替え、リアルタイム音声エージェントなどが、人間らしく聞こえる合成音声への需要を牽引している。
本発表は、Google DeepMindのブログで公開されたもので、グループプロダクトマネージャーのLeland Rechis氏と、Gemini Audioチームを代表するリサーチサイエンス部門ディレクターのAlan Cowen氏が執筆した。
概要としてGoogleは、シンプルな自然言語プロンプトでカスタムボイスをゼロから作成したり既存のボイスを複製したりできること、音声を1行ずつ演出ペースや感情、さらにリアルな会話音まで制御できること、高品質なオーディオブック、ポッドキャスト、大規模リアルタイム音声エージェントに利用できることを説明している。また、透かし(ウォーターマーク)などの安全対策ツールが組み込まれており、生成された音声の安全性を保つという。
異なるワークロード向けの2モデル
Googleは今回の公開を、音声生成を「静的なプリセットから動的なクリエイティブスタジオへ」変革するものと位置付け、クリエイター、開発者、企業がより豊かで表現力豊かな音声体験を構築できるようにすると説明する。同社はさらに、これらのモデルがGemini NotebookやGoogle Vidsといった自社製品でのユーザー体験向上にもつながると付け加えている。
Gemini 3.8 Flash TTSは、深いクリエイティブ演出とキャラクターデザイン向けに構築されている。自然言語プロンプトを使って完全に新しいボイスをゼロから作成し、ゲーム、没入型オーディオブック、ポッドキャスト、インタラクティブメディアでキャラクターを表現できる。演技の指示、ペース、方言の切り替え、相槌(バックチャネリング)を細かく制御しながら、演技を1行ずつ演出することが可能だ。
Gemini 3.8 Flash-Lite TTSは、大容量かつ低コストでのスケール向けに構築されている。Googleによれば、大規模な吹き替え、音声コンテンツ制作、表現力豊かな音声エージェント向けに最適化されており、トーン、ペース、表現のニュアンスを細かく制御できる。FlashとFlash-Liteの棲み分けは、Geminiファミリー全体でGoogleがすでに採用している命名規則に沿ったもので、Lite版は高スループットのワークロード向けの軽量かつ低コストな選択肢として位置付けられている。
この2つのモデルは、3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinkingを含め、急速に拡大しているGemini Audioファミリーを補完するものだ。
自分だけのボイスを作成・カスタマイズ
新モデルにより、Googleは当初の30のオリジナルボイスから、同社が「無限のライブラリ」と呼ぶ規模へと拡大する。完全にオリジナルのキャラクターボイスが欲しい場合でも、一貫したブランドアンバサダーが必要な場合でも、同社はGemini 3.8 Flash Tが本格的なボーカルスタジオを実現し、あらゆる場面で表現力豊かで自然な響きのボイスを作成・活用できると説明する。開発者や企業はその上でカスタム音声体験を構築できる。
今回発表された音声作成機能は以下の通り:
生成型ボイスデザイン。 Gemini 3.8 Flash TTSでは、自然言語プロンプトを通じて、100以上の言語・方言にわたって役割、アクセント、声の特徴をカスタマイズし、独自のボイスをゼロから作成できる。Googleの例では、ドラマチックな火を吐くドラゴンを表現したり、独特の地域的なリズムを持つ魅力的なナレーターを作り上げたりできる。公開に合わせて公開されたデモクリップでは、メルボルン発のハイテンションなDJボイス、極めて薄っぺらい単調なロボットボイス、そして日本のドラゴンの生成が披露されている。
充実のボイスライブラリ。 プロダクション対応の2,000以上のボイスを広範な言語カバーで提供しており、メキシコスペイン語、ケベックフランス語、スコットランド英語などの地域変種を含む。
ボイス複製。 自分の声、あるいは利用権限を持つ声の30秒の音声サンプルから、一貫した声のプロファイルを再現できる。この機能は、組み込みの同意確認、SynthID透かし、C2PAクレデンシャル(メディアの出所と制作過程を記録するオープンな業界標準)によって支えられ、開発者と声の提供者の双方を保護する。
保存と拡張。 作成したカスタムボイスは保存・管理でき、進行中のプロジェクト全体で一貫したパフォーマンスと最小限のドリフトを確保できる。
ボイスリミックス。 近いうちに、ライブラリからボイスを選び、音色、ピッチ、ペース、アクセントを微調整できるようになる。「控えめなアメリカ南部のアクセントを追加する」「話し方を柔らかくする」など、プロンプトで特徴を調整できる。
演技を1行ずつ演出
ボイスを選した後、両TTSモデルは各セリフの話し方を精密に制御できる。ユーザーは自分でト書きを書いてもよいし、自然な脚本キューでGeminiに演出を任せることもできる。冷静なカスタマーサービス担当者から、囁くようなサスペンスシーンまで対応可能だ。Googleのデモでは、インタラクティブな音声エージェント向けの自然で非常に表現力豊かな会話の実現や、精密な脚本制御による深く没入感のある音声体験、自然なターンテイキングを備えた完全に演技された対話シーンの構築が披露されている。
その他のパフォーマンス機能は以下の通り:
長尺生成。 何時間にも及ぶ連続音声でも高音質、自然なペース、キャラクターの声質を維持し、話者ドリフトを最小限に抑える。Googleはこれをポッドキャストやオーディオブックに最適として位置付けている。
ネイティブな2話者シーンステージング。 ポッドキャストでもドラマチックなストーリーテリングでも、1つの脚本からマルチターンの会話をシームレスに演出でき、自然な会話のターンテイキングを保ちながら2つの声を明確に区別できる。
脚本化された発声とバックチャネリング。 <laughs>、<sigh>、<gasp>といった非言語キューと、|mhm|や|yeah|といった相槌の挿入により、現実的な会話の質感を加え、正確なコメディのタイミングやリアクションを表現できる。
ベンチマークと多言語対応
Googleによると、Gemini 3.8 Flash TTSは業界をリードするボイスカスタマイズ性能を備え、音声特化のAI研究企業Hume AIによるサードパーティ評価であるHume AIのVoice Design Benchmarkで71.4のスコアにより総合首位を獲得し、アクセントモデリングでも60.8で首位となった。同社はさらに、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSが信頼性を損なうことなく表現力豊かなパフォーマンスを実現し、Hume AIのOverall Quality Indexでそれぞれ1位と2位を獲得したと述べている。
Googleは、Gemini 3.1 Flash TTSと比較して、新モデルは長尺コンテンツや2話者の脚本制御など幅広いユースケースで大幅な改善を示していると説明する。
リスがどのモデルの生成かを知らずに匿名サンプルを比較するVoice Arenaでのブラインドの人間選好評価では、Gemini 3.8 Flash TTSとFlash-Lite TTSが、日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語(MSA)、メキシコスペイン語、ヒンディー語など、主要なグローバル言語で競合の中でも上位の座を獲得した。100以上の言語に対応することで、同社はこれらのモデルがクリエイター、開発者、企業が世界中で高品質な多言語音声体験を構築できるようにすると述べている。
安全性、同意、透明性
Googleは、声の提供者を保護し、アイデンティティを尊重し、コンテンツの透明性を確保するため、厳格な安全対策を備えて音声作成・複製機能を構築したと説明する。ボイス複製では同意確認を活用しており、ボイスを作成する前に、リファレンス話者と一致する声の所有者による口頭同意の録音をユーザーが提供する必要がある。この安全対策は、生成音声における最も注目されるリスクの一つ、すなわちクローン音声のなりすましや詐欺への悪用に対応するものであり、同意・検証ワークフローはAI政策の議論の焦点となっている。
より広く、Gemini Audioモデルが生成したすべての音声クリップにはSynthIDによる透かしが埋め込まれる。SynthIDはAI生成コンテンツを識別するDeepMindの透かし技術であり、Googleはこの透かしを知覚できず音声出力に直接織り込まれるものと説明し、AI生成音声の検出可能性を維持して誤情報の防止に役立てている。同社の安全・責任への取り組みの詳細は、Gemini 3.8音声モデルカードで確認できる。
Googleは地域制限にも言及しており、AI Studio経由のボイス複製は、イリノイ州、テキサス州、欧州経済領域(EEA)、英国、スイス、インドでは利用できない。
Google AI Studioのボイスデザインワークスペース
本日より、開発者はGoogle AI Studioで新しい音声生成機能を試すことができる。ボイスデザインワークスペースのように構築されたこのツールでは、完全に新しい声のアイデンティティをゼロからプロンプトで作するか自分の声を複製し、それをデュアルスピーカーの脚本エディタに直接取り込んで、1行ずつの演出を行うことができる。
開発者プラットフォームとパートナー企業
Gemini APIを通じて、Agora、LiveKit、Pipecat、Vercelといった開発者プラットフォーム群(リアルタイム通信インフラ、音声エージェントフレームワーク、デプロイツールを網羅)により、開発者は高性能な音声生成体験を容易に構築・デプロイできる。
Googleはまた、Figma、HeyGen、Linguana、Wondercraft、99.co、Ollangといった企業と提携しており、これらの企業は最新のTTSモデルを統合し、グローバル吹き替えの加速、繊細な地域アクセントによるメディアのローカライズ、大規模な対話型音声エージェントの実現を進めている。
提供状況
両モデルとも本日より展開が開始される。
Gemini 3.8 Flash TTS:
- 開発者向け:Gemini APIとGoogle AI Studioで利用可能。
- 企業向け:Gemini Enterprise経由のAPI提供が近日予定。
- 一般向け:Gemini Notebookで利用可能。
Gemini 3.8 Flash-Lite TTS:
- 開発者向け:Gemini APIとGoogle AI Studioで利用可能。
- 企業向け:Gemini Enterprise経由のAPI提供が近日予定。
- 一般向け:Google Vidsで利用可能。
Googleが「近日公開」とした機能、すなわちボイスリミックスとGemini Enterprise経由のAPIアクセスは、本日の発表パートナーや早期アクセス拠点を超えて展開が広がる中で、次に注目すべきマイルストーンとなる。
今回の公開により、Gemini Audioのラインアップは、ライブ翻訳と文字起こし、3.8 Liveおよび3.8 Live Extended Thinkingによるリアルタイム音声会話、そして今回の表現力豊かな音声生成へと拡大し、クリエイター、開発者、企業に音声駆動型製品を構築するための単一のモデルファミリーを提供する。