新闻宏观经济Tavus 称其 Griffin AI 在实时视频通话中让 48% 的用户误以为对方是真人

Tavus 称其 Griffin AI 在实时视频通话中让 48% 的用户误以为对方是真人

作者: Decrypt·

要点速览

  • •Tavus 称其 Griffin-Lite 模型在 1 分钟视频通话中使 54 名参与者中的 26 人(48%)相信自己正在与真人交谈,而其上一代系统仅骗过了 41 名参与者中的 2.4%。
  • •该结果发布于 Tavus 自己的研究页面,X 上的一条社区笔记已指出其既未经独立验证,也未遵循标准测试协议。
  • •在 NVIDIA 独立运行的 VideoFDB 基准测试中,Griffin-Lite 以 3.83(满分 5 分)的生成得分排名第一,但其 3.73 的感知得分仍低于人类参考值 4.20。
  • •Griffin 采用全双工模式,能够同时聆听、观察和说话,在 NVIDIA H100 芯片上的平均音视频延迟为 0.43 秒,Tavus 称这是次快方法的一半。
  • •Griffin-Lite 目前仅限于少数受信任的测试者以研究预览形式使用,Tavus 表示在公开发布前需要安全保障措施和披露功能。
Tavus 称其 Griffin AI 在实时视频通话中让 48% 的用户误以为对方是真人

AI 初创公司 Tavus 表示,其新模型 Griffin 在实时视频通话中让 48% 与其交谈的人相信自己正在与真人对话。

该公司于 10 月 1 日发布了 Griffin,并将其定位为首个「人类交互模型」(Human Interaction Model)——一种旨在理解并生成面对面对话的 AI,不仅关注言语,还会留意面部表情和停顿。Tavus 称,在同样的测试中,其上一代系统的得分仅为 2.4%。

在实验中,Tavus 测试的版本 Griffin-Lite 面对了 54 名参与者,其中 26 人在事后表示,他们相信自己的对话对象是真人。上一代系统面对 41 人,仅骗过了其中一人。

据 Tavus 介绍,参与者被告知将与另一个人进行一场 1 分钟的视频通话,话题是「今年你期待什么」。直到结束时,他们才被问到是否曾想过对方可能不是真人。

这一设置不同于英国数学家 Alan Turing 于 1950 年提出的经典图灵测试。在图灵测试中,裁判会同时与一名隐藏的真人和一台隐藏的机器对话,并需要判断谁是哪个。而在 Tavus 的测试中,通话中的任何人都未曾被告知对方可能是机器人。

该结果发布于 Tavus 自己的研究页面,参与者是通过该公司所称的一个独立研究平台招募的。X 上的一条社区笔记已经指出,这一结果未经独立验证,也未遵循标准测试协议——也就是说,48% 这一数字目前仅基于该公司自己的数据。Tavus 表示,产生怀疑的参与者通常在 20 秒内就察觉了异常。

AI 系统向这一里程碑靠近已有一段时间。根据加州大学圣地亚哥分校的一项研究,OpenAI 的 GPT-4.5 在被提示扮演一名内向、精通网络的年轻人时,在 73% 的对话中让裁判相信自己是人类——但那项测试仅限于文本。Griffin 则实时加入了面部和声音。

在测试实时音视频对话的 NVIDIA VideoFDB 基准测试中,Tavus 称 Griffin-Lite 排名第一。在评估模型回复的自然度和表现力的生成赛道上,Griffin-Lite 得分为 3.83(满分 5 分),而排名第二的系统为 2.80,人类参考值为 3.92。

衡量模型是否理解所见所闻的感知赛道则显示出 Griffin 仍落后于人类之处。Griffin-Lite 得分为 3.73,高于最强基线的 3.44,但低于人类参考值 4.20。Tavus 表示,该评估由 NVIDIA 独立运行。

Griffin 还是全双工的,这意味着它可以同时聆听、观察和说话——更像打电话,而不是对讲机。在 Tavus 的演示,该模型根据看到的三阶魔方状态指导一名男子完成还原,并在他停下来思考时耐心等待。在 AI 数据中心所用的 NVIDIA H100 芯片上,其平均音视频延迟为 0.43 秒,Tavus 称这是次快方法的一半。

这一进展的意义远不止于实验室,因为诈骗者已经在利用视频通话作案。今年 1 月,与朝鲜有关的黑客在 Zoom 或 Teams 通话中使用深度伪造(deepfake)视频——即模仿真人的 AI 生成视频——冒充受信任的联系人。安全研究人员将此次入侵归因于 Lazarus Group 旗下的 BlueNoroff,受害者被诱导安装伪装成音频修复工具的恶意软件。用于 AI 计算的去中心化网络 Gonka 的联合创始人 David Liberman 在该报告中表示,照片和视频已不能再作为事物真实性的证明——而当时使用的模型还不如 Griffin 先进。

各公司已在即兴制定防御措施。2025 年,Kraken 标记了一名疑似朝鲜籍的求职者,此前其安全团队提出了即兴问题,例如要求出示政府身份证件并提供当地餐厅的名称。该候选人表现得很吃力。

Decrypt 自行尝试测试 Tavus 模型的结果令人失望。经过一番调查后发现,Griffin-Lite 并未向客户开放,而是仅限于少数受信任的测试者以研究预览形式使用,且该公司表示正在开发披露功能,并与 AI 安全组织合作。Tavus 称,Griffin 在公开发布前需要完善安全保障措施——这些保障措施的具体形态,以及更广泛访问何时开放,是接下来值得关注的进展。

Tavus 于 2025 年 11 月完成了由 CRV 领投的 4000 万美元 B 轮融资。得分 2.4% 的上一代系统拼接了三个独立模型,分别负责视觉、对话和感知。受信任的测试者可通过在 Tavus 网站上提交表格申请使用 Griffin-Lite。

Originally reported byDecrypt](https://decrypt.co/379975/tavus-griffin-ai-fools-people-video-thinking-human).