ニュースマクロTavus、Griffin AIがライブ動画通話で48%の人を「人間だ」と思わせたと発表

Tavus、Griffin AIがライブ動画通話で48%の人を「人間だ」と思わせたと発表

著者: Decrypt·

重要ポイント

  • •Tavusによると、同社のGriffin-Liteモデルは1分間の動画通話で54人中26人(48%)の参加者に実在の人物と話していると信じ込ませ、従来システムは41人中わずか2.4%しか騙せなかった。
  • •この結果はTavus自身の研究ページで公開されたものであり、X上のコミュニティノートで、独立検証されておらず標準プロトコルに従っていないと指摘されている。
  • •NVIDIAが独立して実施したVideoFDBベンチマークでは、Griffin-Liteが生成スコア5点満点中3.83で首位となったが、知覚スコアは3.73で人間の基準値4.20には及ばなかった。
  • •Griffinは全二重方式で動作し、同時に聞き・見て・話すことが可能で、NVIDIA H100チップ上での平均遅延は0.43秒。Tavusはこれは次に速い手法の半分だと述べている。
  • •Griffin-Liteは現在、研究プレビューとして信頼できるテスターに限定されており、Tavusは公開前に安全対策と示機能が必要だとしている。
Tavus、Griffin AIがライブ動画通話で48%の人を「人間だ」と思わせたと発表

AIスタートアップのTavusは、新モデル「Griffin」がライブ動画通話で話した相手の48%に「実在の人間と話している」と信じ込ませたと発表した。

同社は10月1日、Griffinを発表し、言葉だけでなく表情や間合いにも注目して対面会話を理解・生成するために構築された、初の「Human Interaction Model」と位置付けている。同じテストで、従来のシステムはわずか2.4%のスコアだったとTavusは述べている。

実験では、TavusがテストしたバージョンであるGriffin-Liteが54人と対面し、うち26人が会話相手は実在の人物だと確信したと後に回答した。従来のシステムは41人を相手にし、騙せたのはちょうど1人だけだった。

Tavusによると、参加者は「今年楽しみにしていること」をテーマにした1分間の動画通話で別の人物とマッチングされると告げられていた。相手が実在しない可能性を思いついたかどうかを尋ねられたのは、通話の最後だけだった。

この方式は、1950年に英国の数学者アラン・チューリングが提案した古典的なチューリング・テストとは異なる。チューリング・テストでは、審査員が隠れた人間と隠れた機械の両方と会話し、どちらがどちらかを見極める必要がある。Tavusのテストでは、通話相手にボットがいる可能性について誰も告げられていなかった。

結果はTavus自身の研究ページでされており、参加者は同社が「独立した研究プラットフォーム」と呼ぶものを通じて募集された。X上のコミュニティノートはすでに、この結果が独立検証されておらず、標準的なプロトコルに従っていないと指摘している。つまり、48%という数字は現時点では同社自身の数値に依存している。Tavusは、疑念を抱いた参加者は通常20秒以内にそうなったと述べている。

AIシステムがこのマイルストーンに近づいてきたのは、しばらく前からの動きだ。UCサンディエゴ校の研究によると、OpenAIのGPT-4.5は、内向的でネットに詳しい若者を演じるよう指示された場合、会話の73%で審査員に人間だと信じ込ませた。ただし、このテストはテキストのみだった。Griffinはこれにリアルタイムで顔と声を加えた。

ライブの音声・動画会話をテストするNVIDIAのVideoFDBベンチマークでは、TavusによるとGriffin-Liteが首位を獲得した。モデルの応答の自然さと表現力を評価する生成トラックでは、Griffin-Liteは5点満点中3.83を記録し、2位のシステムは2.80、人間の基準値は3.92だった。

モデルが見たり聞いたりした内容を理解しているかを測る知覚トラックは、Griffinが依然として人間に及ばない部分を示している。Griffin-Liteは3.73を記録し、最強のベースラインの3.44は上回ったものの、人間の基準値である4.20には届かなかった。Tavusは、この評価はNVIDIAが独立して実施したと述べている。

Griffinは全二重(full-duplex)でもあり、トランシーバーではなく電話のように、同時に聞き、見て、話すことができる。Tavusのデモでは、モデルが手元の様子を見ながら男性のルービックキューブ解きを指導し、彼が考えて沈黙したときには待機する。AIデータセンターで使われるNVIDIA H100チップ上での音声から動画までの平均遅延は0.43秒で、Tavusはこれは次に速い手法の半分だと述べている。

この進歩は研究室の外でも重要だ。なぜなら、詐欺師はすでに動画通話を利用しているからだ。1月には、北朝鮮に連なるハッカーが、実在の人物を模したAI生成動画であるディープフェイクをZoomやTeamsの通話で使用し、信頼できる連絡先になりすます事例が発生した。セキュリティ研究者はこの侵入をラザルスグループ傘下のBlueNoroffの仕業と特定しており、被害者は音声修正ツールに偽装したマルウェアのインストールへと誘導された。分散型AIコンピューティングネットワークGonkaの共同創設者であるDavid Liberman氏は、この報道の中で、写真や動画はもはや実在の証拠として信頼できないと述べている。当時使われたモデルはGriffinほど高度ではなかった。

企業はすでに即興の防御策を講じている。2025年、Krakenは、セキュリティチームが政府発行の身分証や地元のレストラン名を尋ねるといった即興の質問をした結果、北朝鮮籍とみられる求職者を検知した。候補者は回答に苦しんだ。

Decrypt自身もTavusのモデルをテストしようとしたが、結果はがっかりさせるものだった。調査の結果、Griffin-Liteは顧客には提供されておらず、研究プレビューとして信頼できるテスターに限定されていることがわかった。同社は開示機能の開発とAI安全機関との連携を進めているという。Tavusは、Griffinには公開前に安全対策が必要だと述べており、その安全策の形と一般公開の時期が次の注目ポイントとなる。

Tavusは2025年11月、CRVが主導する4,000万ドルのシリーズBを調達した。2.4%のスコアを記録した従来のシステムは、映像、対話、知覚の3つの独立したモデルを組み合わせたものだった。信頼できるテスターは、TavusのウェブサイトのフォームからGriffin-Liteへのアクセスを申請できる。

元記事:Decryptによる報告。