НовостиМакроTavus заявляет, что её ИИ Griffin убедил 48% людей во время видеозвонков, что он человек

Tavus заявляет, что её ИИ Griffin убедил 48% людей во время видеозвонков, что он человек

Автор: Decrypt·

Ключевые выводы

  • •По данным Tavus, модель Griffin-Lite убедила 26 из 54 участников (48%) в минутных видеозвонках, что они говорят с реальным человеком, тогда как её ранняя система обманула лишь 2,4% из 41 участника.
  • •Результаты опубликованы на собственной исследовательской странице Tavus и, как отмечено в замечании сообщества на X, не прошли независимую проверку и не соответствуют стандартному протоколу.
  • •В независимо проведённом NVIDIA бенчмарке VideoFDB Griffin-Lite занял первое место с оценкой генерации 3,83 из 5, хотя оценка восприятия 3,73 остаётся ниже человеческого эталона в 4,20.
  • •Griffin работает в полнодуплексном режиме, одновременно слушая, наблюдая и говоря, со средней задержкой аудио-видео 0,43 секунды на чипах NVIDIA H100, что, по словам Tavus, вдвое меньше, чем у следующего по скорости метода.
  • •Griffin-Lite в настоящее время доступен лишь избранным доверенным тестировщикам в рамках исследовательского превью, и Tavus заявляет, что перед публичным релизом необходимы меры безопасности и функции раскрытия информации.
Tavus заявляет, что её ИИ Griffin убедил 48% людей во время видеозвонков, что он человек

ИИ-стартап Tavus сообщает, что его новая модель Griffin убедила 48% людей, общавшихся с ней в видеозвонке в реальном времени, что они разговаривают с настоящим человеком.

Компания представила Griffin 1 октября, назвав его первой «Моделью человеческого взаимодействия» (Human Interaction Model) — ИИ, созданным для понимания и генерации общения лицом к лицу с учётом не только слов, но и мимики и пауз. По словам Tavus, на том же тесте её предыдущая система набрала всего 2,4%.

В эксперименте Griffin-Lite — версия, которую тестировала Tavus — общался с 54 людьми, 26 из которых позже заявили, что считали собеседника реальным человеком. Старая система общалась с 41 человеком и обманула ровно одного.

По данным Tavus, участникам сообщили, что они будут соединены с другим человеком для минутного видеозвонка о том, чего они ждут в этом году. Лишь в конце их спросили, приходило ли им в голову, что собеседник может оказаться ненастоящим.

Эта схема отличается от классического теста Тьюринга, предложенного в 1950 году британским математиком Аланом Тьюрингом, где судья общается и со скрытым человеком, и со скрытой машиной и должен определить, кто есть кто. В тесте Tavus никому из участников не сообщали, что на другом конце может быть бот.

Результаты опубликованы на собственной исследовательской странице Tavus, а участники были набраны через то, что компания называет независимой исследовательской платформой. Замечание сообщества на X уже указало, что результаты не прошли независимую проверку и не соответствуют стандартному протоколу — то есть показатель в 48% пока опирается исключительно на данные самой компании. Tavus утверждает, что участники, у которых возникали подозрения, обычно испытывали их в первые 20 секунд.

ИИ-системы приближаются к этой вехе уже некоторое время. Согласно исследованию Универс Калифорнии в Сан-Диего, GPT-4.5 от OpenAI убедил судей, что он человек, в 73% разговоров, когда ему было поручено сыграть интровертного, разбирающегося в интернете молодого человека — но тот тест был только текстовым. Griffin добавляет лицо и голос в реальном времени.

В бенчмарке NVIDIA VideoFDB, проверяющем живое аудио- и видеообщение, Tavus заявляет, что Griffin-Lite занимает первое место. В треке генерации, оценивающем естественность и выразительность ответов модели, Griffin-Lite получил 3,83 балла из 5 против 2,80 у ближайшего конкурента и 3,92 у эталонного человека.

Трек восприятия, измеряющий, насколько хорошо модель понимает то, что видит и слышит, показывает, где Griffin всё ещё уступает людям. Griffin-Lite набрал 3,73 балла — больше, чем 3,44 у сильнейшей базовой модели, но ниже человеческого эталона в 4,20. По словам Tavus, NVIDIA провела оценку независимо.

Griffin также работает в полнодуплексном режиме, то есть одновременно слушает, смотрит и говорит — скорее как телефонный звонок, чем рация. В демонстрации Tavus модель помогает мужчине собрать кубик Рубика, ориентируясь на то, что видит в его руках, и ждёт, когда он замолкает, чтобы подумать. Средняя задержка от аудио к видео составляет 0,43 секунды на чипах NVIDIA H100, используемых в дата-центрах для ИИ, что, по словам Tavus, вдвое меньше, чем у следующего по скорости метода.

Этот прогресс важен далеко за пределами лабораторий, потому что мошенники уже действуют через видеозвонки. В январе хакеры, связанные с КНДР, использовали дипфейки — сгенерированные ИИ видео, имитирующие реальных людей, — в звонках через Zoom или Teams, выдавая себя за доверенных контактов. Исследователи в области безопасности связали эту атаку с BlueNoroff, подразделением группы Lazarus; жертв убеждали установить вредоносное ПО, замаскированное под исправление звука. Дэвид Либерман, соавтор Gonka, децентрализованной сети для ИИ-вычислений, отметил в том отчёте, что фотографии и видео больше нельзя считать доказательством подлинности — а использовавшиеся тогда модели не были такими продвинутыми, как Griffin.

Компании уже импровизируют с защитой. В 2025 году Kraken пометил подозрительного соискателя, предположительно связанного с КНДР, после того как его служба безопасности задала спонтанные вопросы — например, попросила государственное удостоверение личности и названия местных ресторанов. Кандидат растерялся.

Попытки Decrypt протестировать модели Tavus оказались разочаровывающими. Как выяснилось, Griffin-Lite недоступен клиентам: он огрчен кругом избранных доверенных тестировщиков в рамках исследовательского превью, и компания заявляет, что работает над функциями раскрытия информации и сотрудничает с организациями по безопасности ИИ. Tavus сообщает, что Griffin нуждается в мерах безопасности перед публичным релизом — форма этих мер и сроки более широкого доступа станут следующими событиями, за которыми стоит следить.

Tavus привлекла 40 млн долларов в раунде Series B в ноябре 2025 года под руководством CRV. Раннее, набравшая 2,4% система объединяла три отдельные модели — для визуализации, диалога и восприятия. Доверенные тестировщики могут запросить доступ к Griffin-Lite, заполнив форму на сайте Tavus.

Первоначально опубликовано Decrypt.