ActualitésMacroTavus affirme que son IA Griffin a trompé 48 % des personnes lors d'appels vidéo en direct en leur faisant croire qu'elle était humaine

Tavus affirme que son IA Griffin a trompé 48 % des personnes lors d'appels vidéo en direct en leur faisant croire qu'elle était humaine

Auteur: Decrypt·

Points clés

  • •Tavus affirme que son modèle Griffin-Lite a convaincu 26 des 54 participants — soit 48 % — lors d'appels vidéo d'une minute qu'ils parlaient à une personne réelle, tandis que son système précédent n'avait trompé que 2,4 % des 41 participants.
  • •Les résultats figurent sur la page de recherche de Tavus elle-même et ont été signalés, via une community note sur X, comme n'étant ni vérifiés de manière indépendante ni menés selon un protocole standard.
  • •Sur le benchmark VideoFDB mené de manière indépendante par NVIDIA, Griffin-Lite s'est classé premier avec un score de génération de 3,83 sur 5, bien que son score de perception de 3,73 reste inférieur à la référence humaine de 4,20.
  • •Griffin fonctionne en full duplex, capable d'écouter, d'observer et de parler simultanément, avec une latence audio-vidéo moyenne de 0,43 seconde sur des puces NVIDIA H100 — la moitié de celle de la méthode la plus rapide suivante, selon Tavus.
  • •Griffin-Lite est actuellement réservé à certains testeurs de confiance dans le cadre d'un aperçu de recherche, et Tavus indique que des mesures de sécurité et des fonctionnalités de divulgation sont nécessaires avant une sortie publique.
Tavus affirme que son IA Griffin a trompé 48 % des personnes lors d'appels vidéo en direct en leur faisant croire qu'elle était humaine

La startup IA Tavus affirme que son nouveau modèle, Griffin, a convaincu 48 % des personnes qui lui ont parlé lors d'un appel vidéo en direct qu'elles s'entretenaient avec un véritable humain.

L'entreprise a dévoilé Griffin le 1er octobre, le présentant comme le premier « Human Interaction Model » — une IA conçue pour comprendre et générer des conversations face à face, en prêtant attention aux expressions faciales et aux pauses autant qu'aux mots. Au même test, indique Tavus, son système précédent n'avait obtenu que 2,4 %.

Dans l'expérience, Griffin-Lite — la version testée par Tavus — a été confronté à 54 personnes, dont 26 ont déclaré ensuite avoir cru que leur interlocuteur était une personne réelle. L'ancien système, lui, n'a trompé qu'une seule personne parmi les 41 testées.

Selon Tavus, les participants se sont vu annoncer qu'ils seraient mis en relation avec une autre personne pour un appel vidéo d'une minute portant sur ce qu'ils attendaient avec impatience cette année. Ce n'est qu'à la fin qu'on leur a demandé si l'idée que leur interlocuteur ne soit peut-être pas réel leur avait traversé l'esprit.

Ce dispositif diffère du test de Turing classique proposé en 1950 par le mathématicien britannique Alan Turing, dans lequel un juge dialogue à la fois avec un humain dissimulé et une machine dissimulée et doit déterminer lequel est lequel. Dans le test de Tavus, personne sur l'appel n'a été informé qu'un bot pouvait se trouver à l'autre bout.

Les résultats sont publiés sur la page de recherche de Tavus elle-même, et les participants ont été recrutés via ce que l'entreprise décrit comme une plateforme de recherche indépendante. Une community note sur X a déjà signalé que les résultats ne sont pas vérifiés de manière indépendante et ne suivent pas un protocole standard — ce qui signifie que le chiffre de 48 % repose, pour l'instant, uniquement sur les données de l'entreprise. Tavus indique que les participants devenus méfiants l'ont généralement été en moins de 20 secondes.

Les systèmes d'IA s'approchent de ce jalon depuis un certain temps. Selon une étude de l'UC San Diego, le GPT-4.5 d'OpenAI a convaincu des juges qu'il était humain dans 73 % des conversations lorsqu'il était invité à jouer un jeune personne introvertie et à l'aise sur Internet — mais ce test était uniquement textuel. Griffin ajoute un visage et une voix, en temps réel.

Sur le benchmark VideoFDB de NVIDIA, un test de conversation audio et vidéo en direct, Tavus affirme que Griffin-Lite se classe premier. Sa piste de génération, qui évalue le naturel et l'expressivité des réponses d'un modèle, a attribué à Griffin-Lite un score de 3,83 sur 5, contre 2,80 pour le système suivant et 3,92 pour la référence humaine.

La piste de perception, qui mesure la compréhension par un modèle de ce qu'il voit et entend, révèle où Griffin est encore en retrait par rapport aux humains. Griffin-Lite a obtenu 3,73, devant le meilleur score de référence de 3,44 mais en dessous de la référence humaine de 4,20. Tavus indique que NVIDIA a mené l'évaluation de manière indépendante.

Griffin est également full-duplex, c'est-à-dire qu'il écoute, observe et parle en même temps — davantage comme un appel téléphonique que comme un talkie-walkie. Dans une démonstration de Tavus, le modèle guide un homme dans la résolution d'un cube Rubik en fonction de ce qu'il voit dans ses mains, et patiente lorsqu'il se tait pour réfléchir. La latence audio-vidéo moyenne est de 0,43 seconde sur des puces NVIDIA H100, du type de celles utilisées dans les centres de données d'IA, soit, selon Tavus, la moitié de celle de la méthode la plus rapide suivante.

Cette avancée a des implications bien au-delà du laboratoire, car les escrocs opèrent déjà lors d'appels vidéo. En janvier, des hackers liés à la Corée du Nord ont utilisé des deepfakes — des vidéos générées par IA imitant une personne réelle — lors d'appels sur Zoom ou Teams pour se faire passer pour des contacts de confiance. Les chercheurs en sécurité ont attribué l'intrusion à BlueNoroff, une filiale du groupe Lazarus, et les victimes ont été poussées à installer un logiciel malveillant déguisé en correctif audio. David Liberman, co-créateur de Gonka, un réseau décentralisé de calcul IA, déclarait dans ce rapport que les photos et vidéos ne peuvent plus être considérées comme une preuve de véracité — et les modèles utilisés à l'époque n'étaient pas aussi avancés que Griffin.

Les entreprises improvisent déjà leurs défenses. En 2025, Kraken a signalé un candidat soupçonné d'être nord-coréen après que son équipe de sécurité lui a pos des questions spontanées, comme la présentation d'une pièce d'identité officielle et le nom de restaurants locaux. Le candidat a eu du mal à répondre.

Les tentatives de Decrypt pour tester les modèles de Tavus se sont avérées décevantes. Après quelques recherches, il s'avère que Griffin-Lite n'est pas accessible aux clients ; il est réservé à certains testeurs de confiance dans le cadre d'un aperçu de recherche, et l'entreprise indique travailler sur des fonctionnalités de divulgation et avec des organisations de sécurité de l'IA. Tavus affirme que Griffin nécessite des mesures de sécurité avant une sortie publique — la forme de ces garde-fous, ainsi que la date d'un accès élargi, constituant les prochains développements à surveiller.

Tavus a levé une Série B de 40 millions de dollars en novembre 2025, menée par CRV. L'ancien système, qui avait obtenu 2,4 %, assemblait trois modèles distincts — un pour le visuel, un pour le dialogue et un pour la perception. Les testeurs de confiance peuvent demander l'accès à Griffin-Lite en remplissant un formulaire sur le site de Tavus.

Article originalement publié par Decrypt.