Google、リアルタイム会話AIを実現する「Gemini 3.8 Live」音声モデルを発表
重要ポイント
- •Googleは9月15日、ライブ会話中に推論とタスク実行が可能な音声エージェント構築向けに設計された音声モデル、Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingをリリースした。
- •モデルは音声レスポンスをストリーミングしながらAPIおよびツール呼び出しを実行でき、ライブの視覚入力に対応し、97以上の言語をサポートしている。
- •Extended Thinking版には、モデルの内部推論をオン・オフできる「設定可能な思考」機能が含まれる。
- •このアーキテクチャーは対話レイテンシと推論レイテンシを分離し、回答を待つために停止するのではなく、バックグラウンドで推論を継続しながらエージェントが会話を進められるようにする。
- •アナリストは、GoogleがAppleなどのベンダーに追いつきつつリアルタイムAI対話を前進させていると見ており、企業向け活用例にはカスタマーサポートのチャットボット、営業プロセス、マルモーダルのエージェント型アプリケーションが含まれる。

Googleは、より深い推論能力、高い対話性、会話速度を備えたインテリジェントなAIエージェントを企業が展開できるようにする、2つの新音声モデルを発表した。
9月15日に公開されたGemini 3.8 LiveおよびGemini 3.8 Live Extended Thinkingにより、開発者は会話の流れを維持しながら推論とタスク実行ができる音声エージェントを構築できるとGoogleは述べている。これらのモデルは、従来のプロンプト・レスポンス型の構造にとらわれないリアルタイムな対話をサポートし、個別のプロンプトを送るのではなく自然に会話することが可能だ。
モデルの主な機能には、ユーザーへの音声レスポンスのストリーミングを継続しながらAPIおよびツール呼び出し(エージェントが外部システムと接続しタスクを実行する仕組み)を実行すること、エージェントがユーザーの発言と視覚情報の両方を理解できるよう支援するライブの視覚入力への対応、そして複数地域で音声エージェントを展開する企業に関連する97以上の言語のサポートが含まれる。Extended Thinking版は、AIモデルの内部推論をオン・オフできる「設定可能な思考(configurable thinking)」機能を追加した。
今回のリリースは、GoogleがGemini 3.8 Flashおよび3.8 Cyber基盤モデルを初めて発表してから2週間後のことだ。
Futurum Groupのアナリスト、ブラッドリー・シムミン(Bradley Shimmin)氏は、3.8 Liveの能力により、GoogleはNotesやボイスメモなどの生産性アプリでリアルタイム文字起こしをすでに提供しているAppleなどのベンダーに追いつきつつあるように見えると述べた。その上で同氏は、Googleの技術はユーザーとAIの関わり方を変えることで、さらなる段階に進んでいるとも語った。
本物の会話
「そのアーキテクチャーの設計上、さまざまな振る舞いにカスタマイズできる」とシムミン氏は述べた。同氏は、企業が従来型の翻訳ユースケースでモデルを利用できる一方で、Googleはユーザーがプロンプト・レスポンス方式ではなく、本物会話ができるようにモデルを設計したと指摘した。
「自然な会話の中で、リアルタイムに割り込んで情報を注入できる。何かを行っている処理を中断させることなく、会話にコンテキストを注入できる」とシムミン氏は述べた。
Tekonyxの創業者、シッド・ナグ(Sid Nag)氏は、Googleの高度な音声技術により、新しいモデルは質問の表面的な意味だけに答えるわけではないと述べた。
「このモデルはバックグラウンドで推論を行うよう設計されている。会話の中で推論を実行するため、推論しながら会話を続けられる」とナグ氏は述べた。
この技術は、対話レイテンシ(ユーザーがアクションを実行してからシステムが応答するまでの遅延)を、推論レイテンシ(AIモデルが情報を処理するのにかかる合計時間)から分離する進歩である。この分離こそが、回答が準備できるまで対話を停止するのではなく、バックグラウンドで推論を継続しながらエージェントが会話を進められる理由である。
「停止してから別の回答を返すのではなく、リアルタイムで実行している」とナグ氏は述べた。
さらに同氏は、音声モデルはAIエージェントの応答と対話のあり方も変えるとし、「AIエージェントは、速さと思考深さのどちらかを選ばなければならないわけではない。実際にリアルタイムな対話を維持できる」と続けた。
新しいモデルの企業向け活用例には、カスタマーサポートのチャットボット、営業プロセス、テキスト・音声・映像を組み合わせたマルチモーダルのエージェント型アプリケーションが含まれるとナグ氏は述べた。エージェント型アプリケーションとは、AIエージェントがプロンプトに単純に応答するのではなく、推論とタスク実行を行うソフトウェアであり、新しいモデルが提供する会話中のツール呼び出しとバックグラウンド推論に依存する形態だ。
AI Businessのエスター・シットゥー(Esther Shittu)記者による報道。原文: Gemini 3.8 Live Transforms Conversational AI、2026年9月17日公開。