Tavus 稱其 Griffin AI 在視訊通話中讓 48% 的人誤以為它是真人
重點速覽
- •Tavus 表示其 Griffin-Lite 模型在一分鐘視訊通話中讓 54 位參與者中的 26 位(48%)相信自己是在與真人交談,而其前代系統僅讓 41 位參與者中的 2.4% 信以為真。
- •這些結果出現在 Tavus 自己的研究頁面上,且透過 X 上的一則社群備註被指出既未經獨立驗證,也未遵循標準協議。
- •在 NVIDIA 獨立執行的 VideoFDB 基準測試中,Griffin-Lite 以 5 分制中 3.83 的生成得分排名第一,但其 3.73 的感知得分仍低於人類參考值 4.20。
- •Griffin 採用全雙工運作,可同時聆聽、觀看與說話,在 NVIDIA H100 晶片上平均音訊到視訊延遲為 0.43 秒,Tavus 稱此為次快方法的一半。
- •Griffin-Lite 目前僅作為研究預覽版限量提供給受信任測試者,Tavus 表示在公開發布前需要安全措施與揭露功能。

AI 新創公司 Tavus 表示,其新模型 Griffin 在即時視訊通話中讓 48% 與其交談的人相信自己是在與真人對話。
該公司於 10 月 1 日發表 Griffin,稱其為首個「人類互動模型」——一款旨在理解並生成面對面對話的 AI,不僅關注言語,也關注面部表情和停頓。Tavus 表示,在同樣的測試中,其前代系統的得分僅為 2.4%。
在實驗中,Tavus 測試的版本 Griffin-Lite 與 54 人進行對話,其中 26 人事後表示他們相信交談對象是真人。前代系統面對 41 人,僅讓 1 人信以為真。
據 Tavus 說明,參與者被告知將與另一位人士進行一分鐘的視訊通話,話題是關於今年期待的事情。直到最後,才被問及是否曾想過對方可能不是真人。
這種設置不同於英國數學家 Alan Turing 於 1950 年提出的經典圖靈測試,後者由裁判同時與隱藏的真人及隱藏的機器交談,並必須判斷哪個是哪個。在 Tavus 的測試中,通話過程中沒有人被告知對端可能是機器人。
結果發布在 Tavus 自己的研究頁面上,參與者則透過該公司所稱的獨立研究平台招募。X 上的一則社群備註已指出,這些結果既未經獨立驗證,也未遵循標準協議——也就是說,48% 這個數字目前仍基於該公司自己的數據。Tavus 表示,產生懷疑的參與者通常在 20 秒內便有所察覺。
AI 系統朝向這一里程碑發展已有一段時間。根據加州大學聖地牙哥分校的一項研究,OpenAI 的 GPT-4.5 在被提示扮演一位內向、熟悉網路的年輕人時,在 73% 的對話中讓評審相信它是真人——但該測試僅限文字。Griffin 則加入了即時的面容與聲音。
在 NVIDIA 的 VideoFDB 基準測試——一項針對即時音與視訊對話的測試中,Tavus 表示 Griffin-Lite 排名第一。其生成軌道評分模型回應的自然度與表現力,Griffin-Lite 獲得 5 分中的 3.83 分,而次佳系統為 2.80 分,人類參考值為 3.92 分。
感知軌道衡量模型對所見所聞的理解程度,顯示 Griffin 仍落後於人類之處。Griffin-Lite 得分 3.73,高於最強基線的 3.44,但低於人類參考值 4.20。Tavus 表示該評測由 NVIDIA 獨立執行。
Griffin 還具備全雙工能力,可同時聆聽、觀看與說話——更像電話而非對講機。在一段 Tavus 示範中,模型根據眼前的畫面指導一名男子解魔術方塊,並在他安靜思考時耐心等待。在 NVIDIA H100 晶片上,音訊到視訊的延遲平均為 0.43 秒,Tavus 表示這是次快方法的一半。
這項進展的影響遠超出實驗室,因為詐騙者早已在視訊通話中活動。今年 1 月,與北韓有關聯的駭客在 Zoom 或 Teams 通話中使用深度偽造——即模仿真人的 AI 生成影片——冒充可信聯絡人。安全研究人員將該入侵事件歸因於 BlueNoroff,即 Lazarus Group 的分支機構,受害者被誘騙安裝偽裝成音訊修復工具的惡意軟體。AI 去中心化運算網路 Gonka 的共同創作者 David Liberman 在該報導中表示,照片和影片已無法再作為真實性的證明——而當時所使用的模型還不如 Griffin 先進。
各公司已在臨時構築防禦措施。2025 年,Kraken 在其安全團隊提出即興問題——例如要求政府證件及當地餐廳名稱——後,標記了一名疑似北韓求職者。該應徵者應對得相當吃力。
Decrypt 自行嘗試測試 Tavus 的模型,結果令人失望。經過一些調查後發現,Griffin-Lite 並未對客戶開放;它僅作為研究預覽版,限量提供給受信任的測試者,該公司表示正在開發揭露功能,並與 AI 安全組織合作。Tavus 表示,Griffin 在公開發布前需要安全措施——這些保障措施的具體形態以及何時開放更廣泛的存取,將是接下來值得關注的進展。
Tavus 於 2025 年 11 月完成由 CRV 領投的 4,000 萬美元 B 輪融資。得分為 2.4% 的前代系統將三個獨立模型拼接而成——分別負責視覺、對話與感知。受信任測試者可透過在 Tavus 網站提交表格來申請使用 Griffin-Lite。
原文報導來源:Decrypt。