Tavus Zegt Dat Zijn Griffin-AI 48% Van De Mensen in Live Videogespreken Liet Geloven Dat Het Een Mens Was
Belangrijkste punten
- •Tavus zegt dat zijn Griffin-Lite-model 26 van 54 deelnemers — 48% — overtuigde in videogesprekken van één minuut dat ze met een echt persoon spraken, terwijl het eerdere systeem slechts 2,4% van 41 deelnemers overtuigde.
- •De bevindingen verschijnen op de eigen onderzoekspagina van Tavus en zijn, via een communitynote op X, aangemerkt als niet onafhankelijk geverifieerd en niet uitgevoerd volgens een standaard protocol.
- •Op NVIDIA's onafhankelijk uitgevoerde VideoFDB-benchmark stond Griffin-Lite eerste met een generatiescore van 3,83 uit 5, hoewel de perceptiescore van 3,73 onder de menselijke referentie van 4,20 bleef.
- •Griffin werkt in full duplex en kan tegelijkertijd luisteren, kijken en spreken, met een gemiddelde audio-naar-video-vertraging van 0,43 seconde op NVIDIA H100-chips, wat volgens Tavus de helft is van de snelste volgende methode.
- •Griffin-Lite is momenteel beperkt tot een selecte groep vertrouwde testers als onderzoeksvoorbeeld, en Tavus zegt dat veiligheidsmaatregelen en disclosure-functies nodig zijn vóór een publieke release.

AI-startup Tavus zegt dat zijn nieuwe model, Griffin, 48% van de mensen met wie het in een live videogesprek sprak overtuigde dat ze met een echte mens spraken.
Het bedrijf onthulde Griffin op 1 oktober en positioneerde het als het eerste "Human Interaction Model" — een AI die is gebouwd om face-to-face gesprekken te begrijpen en te genereren, waarbij naast woorden ook aandacht wordt besteed aan gezichtsuitdrukkingen en pauzes. Op dezelfde test scoorde het vorige systeem van Tavus, aldus het bedrijf, slechts 2,4%.
In het experiment kreeg Griffin-Lite — de versie die Tavus testte — te maken met 54 mensen, van wie er 26 achteraf zeiden dat ze geloofden dat hun gesprekspartner een echt persoon was. Het oudere systeem kreeg te maken met 41 mensen en overtuigde er precies één.
Volgens Tavus kregen deelnemers te horen dat ze zouden worden gekoppeld aan een ander persoon voor een videogesprek van één minuut over waar ze dit jaar naar uitzagen. Pas aan het einde werd hen gevraagd of ze eraan hadden gedacht dat hun partner misschien niet echt was.
Die opzet verschilt van de klassieke Turing-test die in 1950 werd voorgesteld door de Britse wiskundige Alan Turing, waarbij een beoordelaar met zowel een verborgen mens als een verborgen machine praat en moet uitzoeken wie wat is. In de test van Tavus kreeg niemand in het gesprek te horen dat er mogelijk een bot aan de andere kant zat.
De resultaten zijnubliceerd op de eigen onderzoekspagina van Tavus, en de deelnemers werden geworven via wat het bedrijf een onafhankelijk onderzoeksplatform noemt. Een communitynote op X heeft al aangegeven dat de bevindingen niet onafhankelijk zijn geverifieerd en niet volgens een standaard protocol zijn uitgevoerd — wat betekent dat de 48%-kop voorlopig op de eigen cijfers van het bedrijf rust. Tavus zegt dat de deelnemers die achterdocht kregen dat doorgaans binnen 20 seconden deden.
AI-systemen bewegen al enige tijd richting deze mijlpaal. Volgens een studie van UC San Diego overtuigde OpenAI's GPT-4.5 beoordelaars in 73% van de gesprekken dat het een mens was, toen het werd gevraagd een introverte, internetvaardige jongere te spelen — maar die test was alleen tekstueel. Griffin voegt een gezicht en een stem toe, in realtime.
Op NVIDIA's VideoFDB-benchmark, een test voor live audio- en videoconversaties, zegt Tavus dat Griffin-Lite eerste staat. Het generatiespoor, dat beoordeelt hoe natuurlijk en expressief de reacties van een model zijn, gaf Griffin-Lite een score van 3,83 uit 5, tegenover 2,80 voor het op één na beste systeem en 3,92 voor een menselijke referentie.
Het perceptiespoor, dat meet of een model begrijpt wat het ziet en hoort, laat zien waar Griffin nog achterloopt op mensen. Griffin-Lite scoorde 3,73, boven de 3,44 van de sterkste baseline maar onder de menselijke referentie van 4,20. Tavus zegt dat NVIDIA de evaluatie onafhankelijk heeft uitgevoerd.
Griffin is ook full-duplex, wat betekent dat het tegelijkertijd luistert, kijkt en praat — meer als een telefoongesprek dan als een walkie-talkie. In een Tavus-demo begeleidt het model een man bij het oplossen van een Rubiks kubus op basis van wat het in zijn handen ziet, en wacht het wanneer hij stil is om na te denken. De audio-naar-video-vertraging is gemiddeld 0,43 seconde op NVIDIA H100-chips, het soort chips dat in AI-datacenters wordt gebruikt, wat volgens Tavus de helft is van de snelste volgende methode.
De vooruitgang is belangrijk ver buiten het lab, want oplichters zijn al actief in videogesprekken. In januari gebruikten met Noord-Korea gelinkte hackers deepfakes — door AI gegenereerde video die een echt persoon imiteert — in Zoom- of Teams-gesprekken om zich voor te doen als vertrouwde contacten. Beveiligingsonderzoekers schreven het incident toe aan BlueNoroff, een dochteronderneming van de Lazarus Group, en slachtoffers werden overgehaald malware te installeren die zich voorgaf als een audiofix. David Liberman, medeoprichter van Gon, een gedecentraliseerd netwerk voor AI-computing, zei in dat rapport dat foto's en video niet langer als bewijs kunnen worden vertrouwd dat iets echt is — en de modellen die toen werden gebruikt waren niet zo geavanceerd als Griffin.
Bedrijven improviseren al met hun verdediging. In 2025 markeerde Kraken een vermoedelijke Noord-Koreaanse sollicitant nadat zijn beveiligingsteam spontane vragen stelde, zoals het vragen om een identiteitsbewijs en de namen van lokale restaurants. De kandidaat kwam in de problemen.
De pogingen van Decrypt om Tavus' modellen zelf te testen vielen tegen. Na wat onderzoek bleek dat Griffin-Lite niet beschikbaar is voor klanten; het is beperkt tot een selecte groep vertrouwde testers als onderzoeksvoorbeeld, en het bedrijf zegt te werken aan disclosure-functies en samen te werken met AI-veiligheidsorganisaties. Tavus zegt dat Griffin veiligheidsmaatregelen nodig heeft vóór een publieke release — waardoor de vorm van die waarborgen en wanneer bredere toegang beschikbaar komt, de volgende ontwikkelingen zijn om in de gaten te houden.
Tavus haalde in november 2025 een Series B van $40 miljoen op onder leiding van CRV. Het eerdere systeem dat 2,4% scoorde, bestond uit drie aparte modellen — één voor visuals, één voor dialoog en één voor perceptie. Vertrouwde testers kunnen toegang tot Griffin-Lite aanvragen door een formulier in te dienen op de Tavus-website.
Oorspronkelijk gemeld door Decrypt](https://decrypt.co/379975/tavus-griffin-ai-fools-people-video-thinking-human).