ニュース株式Google DeepMind、Gemini 3.8 LiveにLive Avatarを搭載

Google DeepMind、Gemini 3.8 LiveにLive Avatarを搭載

著者: Google DeepMind Blog·

重要ポイント

  • •Live Avatarにより、エンタープライズエージェントが同期された音声と映像を通じて、準リアルタイムで聴き、見、応答できるようになる。
  • •システムは、進行中の会話を中断することなく、バックグラウンドでツールを実行し情報を取得できる。
  • •Live Avatarは97言に対応した多言語音声間同期をサポートし、会話中の言語切り替えにも対応する。
  • •組織はプリセットアバターを選択でき、参照画像からのカスタムアバター作成は許可リストに登録された企業に限られる。
  • •生成された音声と映像にはSynthIDの透かしが埋め込まれ、AI生成コンテンツの識別を支援する。
Google DeepMind、Gemini 3.8 LiveにLive Avatarを搭載

Google DeepMindは2026年9月24日、会話型AIに準リアルタイムの視覚的プレゼンスを追加するGemini 3.8 Live with Live Avatarを発表した。この機能は、Geminiのネイティブなライブ対話機能と低遅延のストリーミング映像を組み合わせ、企業とそのユーザーにより自然で直感的なインタラクションを実現する。

発表は、リサーチサイエンティストのShuo-yiin Chang氏と、ソフトウェアエンジニアのCJ Zheng氏がGemini Audioチームを代表して執筆した。これは先週のGemini 3.8 Liveの公開に続くもの。

Google DeepMindによると、Live Avatarは準リアルタイムの映像生成と音声を組み合わせることで、動的な視覚的ペルソナを通じて聴き、見、話すことを可能にする。この機能は正確なリップシンク、自然な表情、滑らかなターンテイキングを備えた設計となっており、バーチャルサービスをよりインタラクティブにすることを目的としている。同社が挙げた想定用途には、カスタマーサービスやインタラクティブなウォークスルーが含まれる。

Gemini 3.8 Live with Live Avatarは本日よりGemini Enterpriseで利用可能となった。元の発表はGoogle DeepMindブログで閲覧できる。

マルチモーダルな会話

Google DeepMindは、会話が本質的にマルモーダルであり、聴くこと、視覚的な注意、発話、表情が含まれると述べている。Live Avatarは、視覚と音声の入力を同時に処理し、表現力のある音声と映像を組み合わせた応答を生成することで、これらの能力をエンタープライズエージェントにもたらす。

同社は、この機能が目にしたものや耳にした内容を準リアルタイムで取り込み、音声と映像を通じて応答することで、より自然な会話を支えると説明した。Google DeepMindが挙げたカスタマーサービスやインタラクティブなウォークスルーのシナリオでは、表示された内容に反応し、音声と表情の合図で一つの会話の中で応答するバーチャルエージェントが実現する。

バックグラウンドでのツール実行

Live Avatarは、Geminiの推論能力と非同期のツール呼び出しも活用する。会話を継続しながら、バックグラウンドでツール呼び出しを開始し、データを取得できる。これにより、対話を中断することなく複雑なタスクを処理できる。

Google DeepMindは、ホテルのゲストのチェックインを、会話を続けながらツールをバックグラウンドで実行できるタスクの例として挙げた。企業にとっての価値は継続性であり、データ取得とタスク実行が目に見えないところで行われる間、顧客は途切れない会話を体験できる。

97言語への対応

この機能は、ネイティブな多言語音声間同期を備えている。Google DeepMindによると、Live Avatarはリップシンクと表情を動的に適応させながら97言語間を切り替えることができ、映像の品質を損なったり、視覚的なドリフトを生じさせたりしないという。

同社はまた、会話の途中での言語切り替えを実演し、アバターのリップシンクと表情が言語間でシームレスに適応することを示した。複数の地域のユーザーにサービスを提供する企業にとって、このカバレッジと、視覚的な乱れなしに言語を切り替えられる能力は、グローバルな顧客対応に直結。

カスタマイズ可能なアバター

組織は、異なる外見、声、表現スタイルを持つプリセットアバターのライブラリから選択できる。さらに、Live Avatarをカスタマイズして、ブランドやキャラクターのアイデンティティを反映することも可能だ。

開発者は高品質の参照画像をもとに、参照画像の類似性、ブランドのスタイリング、キャラクターのアイデンティティを保持しながら、完全にアニメーション化された応答性の高いアバターを生成できる。Google DeepMindによると、カスタムアバターの作成は現在、エンタープライズ許可リストを通じてのみ提供されており、リスト外の組織にとってはプリセットライブラリが選択肢となる。

透かしと安全性

Google DeepMindは、Live Avatarにアイデンティティを尊重し、AI生成コンテンツの透明性を保つことを目的とした厳格な保護策を組み込んだと述べている。同社のAI製品が生成する出力にはSynthIDによる透かしが付与される。これは音声と映像に直接埋め込まれた、知覚できない透かしである。

同社は、この透かしがAI生成コンテンツの検出可能性を保ち、誤情報と誤帰属を最小限に抑えることを目的としていると説明する。表現力のある映像ペルソナを顧客に提供する企業にとって、この透かしこそが、AI生成のインタラクションを合成コンテンツとして識別可能に保つものとなる。同社の安全性と責任ある展開への包括的なアプローチについての詳細は、モデルカードで確認できる。

Gemini 3.8 Live with Live AvatarはGemini Enterpriseで利用可能である。Google DeepMindはまた、開発者に対し、開始方法についてAPIドキュメントを案内している。プリセットライブラリを超えたブランド固有のアバターを求めるチームにとって、カスタムアバター作成のためのエンタープライズ許可リストが確認すべきアクセス要件となる。