Tavus sagt, seine Griffin-KI habe 48 % der Menschen in Live-Videocalls davon überzeugt, dass sie mit einem Menschen sprächen
Wichtige Erkenntnisse
- •Tavus sagt, sein Modell Griffin-Lite habe 26 von 54 Teilnehmern – 48 % – in Ein-Minuten-Videocalls davon überzeugt, mit einer echten Person zu sprechen, während das Vorgängersystem nur 2,4 % von 41 Teilnehmern täuschte.
- •Die Ergebnisse erscheinen auf Tavus'ener Forschungsseite und wurden in einer Community-Notiz auf X als weder unabhängig verifiziert noch nach einem Standardprotokoll durchgeführt gekennzeichnet.
- •Beim von NVIDIA unabhängig durchgeführten VideoFDB-Benchmark belegte Griffin-Lite den ersten Platz mit einem Generierungswert von 3,83 von 5, blieb bei der Wahrnehmung mit 3,73 jedoch unter dem menschlichen Referenzwert von 4,20.
- •Griffin arbeitet im Vollduplex-Verfahren und kann gleichzeitig hören, sehen und sprechen, mit durchschnittlich 0,43 Sekunden Audio-zu-Video-Verzögerung auf NVIDIA-H100-Chips – laut Tavus halb so viel wie die schnellste Alternative.
- •Griffin-Lite ist derzeit als Forschungsvorschau auf ausgewählte vertrauenswürdige Tester beschränkt; Tavus sagt, vor einer öffentlichen Veröffentlichung seien Sicherheitsmaßnahmen und Kennzeichnungsfunktionen erforderlich.

Das KI-Startup Tavus sagt, sein neues Modell Griffin habe 48 % der Menschen, die in einem Live-Videocall mit ihm sprachen, davon überzeugt, mit einem echten Menschen zu reden.
Das Unternehmen stellte Griffin am 1. Oktober vor und bewarb es als das erste „Human Interaction Model“ – eine KI, die entwickelt wurde, um Gespräche von Angesicht zu Angesicht zu verstehen und zu erzeugen und dabei neben Worten auch Gesichtsausdrücke und Pausen zu berücksichtigen. Bei demselben Test habe das Vorgängersystem von Tavus laut Unternehmen lediglich 2,4 % erreicht.
Im Experiment trat Griffin-Lite – die von Tavus getestete Version – gegen 54 Personen an, von denen 26 anschließend sagten, sie hätten geglaubt, ihr Gesprächspartner sei ein echter Mensch. Das ältere System traf auf 41 Personen und überzeugte genau eine.
Den Teilnehmern wurde laut Tavus gesagt, sie würden mit einer anderen Person für einen Ein-Minuten-Videocall darüber gematcht, worauf sie sich in diesem Jahr freuen. Erst am Ende wurde gefragt, ob ihnen in den Sinn gekommen sei, dass ihr Gegenüber möglicherweise nicht echt sei.
Dieses Setup unterscheidet sich vom klassischen Turing-Test, den der britische Mathematiker Alan Turing 1950 vorschlug und bei dem ein Prüfer mit einem verborgenen Menschen und einer verborgenen Maschine spricht und herausfinden muss, wer wer ist. Bei Tavus' Test wurde niemand im Call darüber informiert, dass sich am anderen Ende ein Bot befinden könnte.
Die Ergebnisse werden auf Tavus' eigener Forschungsseite veröffentlicht; die Teilnehmer wurden über das rekrutiert, was das Unternehmen als unabhängige Forschungsplattform bezeichnet. Eine Community-Notiz auf X hat bereits darauf hingewiesen, dass die Ergebnisse weder unabhängig verifiziert sind noch einem Standardprotokoll folgen – das Schlagwort von 48 % stützt sich vorerst also auf die Zahlen des Unternehmens selbst. Laut Tavus schöpften diejenigen Teilnehmer, die misstrauisch wurden, dies typischerweise innerhalb von 20 Sekunden.
KI-Systeme nähern sich diesem Meilenstein bereits seit einiger Zeit. Laut einer Studie der UC San Diego überzeugte OpenAIs GPT-4.5 Prüfer in 73 % der Gespräche davon, ein Mensch zu sein, wenn es angewiesen wurde, einen introvertierten, internetaffinen jungen Menschen zu spielen – dieser Test war jedoch nur textbasiert. Griffin fügt ein Gesicht und eine Stimme hinzu – in Echtzeit.
Auf NVIDIAs VideoFDB-Benchmark, einem Test für Live-Audio- und Video-Gespräche, belege Griffin-Lite laut Tavus den ersten Platz. In der Generierungs-Spur, die bewertet, wie natürlich und ausdrucksstark die Antworten eines Modells sind, erhielt Griffin-Lite 3,83 von 5 Punkten, gegenüber 2,80 für das zweitbeste System und 3,92 für eine menschliche Referenz.
Die Wahrnehmungs-Spur, die misst, ob ein Modell versteht, was es sieht und hört, zeigt, wo Griffin den Menschen noch hinterherhinkt. Griffin-Lite erzielte 3,73 – vor 3,44 für die stärkste Vergleichsbasis, aber unter dem menschlichen Referenzwert von 4,20. Tavus sagt, NVIDIA habe die Evaluation unabhängig durchgeführt.
Griffin arbeitet außerdem im Vollduplex-Verfahren, was bedeutet, dass es gleichzeitig hört, sieht und spricht – eher wie ein Telefonat als ein Sprechfunkgerät. In einer Tavus-Demo begleitet das Modell einen Mann beim Lösen eines Rubik's Cube anhand dessen, was es in seinen Händen sieht, und wartet, wenn er innehält, um nachzudenken. Die Audio-zu-Video-Verzögerung beträgt auf NVIDIA-H100-Chips – der in KI-Rechenzentren üblichen Art – durchschnittlich 0,43 Sekunden, was laut Tavus halb so viel ist bei der schnellsten Alternativmethode.
Der Fortschritt ist weit über das Labor hinaus relevant, denn Betrüger sind auf Videocalls bereits aktiv. Im Januar setzten mit Nordkorea verbundene Hacker Deepfakes – KI-generierte Videos, die einen echten Menschen imitieren – in Zoom- oder Teams-Calls ein, um sich als vertrauenswürdige Kontakte auszugeben. Sicherheitsforscher führten den Angriff auf BlueNoroff zurück, eine Tochtergruppe der Lazarus Group; den Opfern wurde Schadsoftware unter dem Vorwand einer Audio-Korrektur untergejubelt. David Liberman, Mitentwickler von Gonka, einem dezentralen Netzwerk für KI-Computing, sagte in diesem Bericht, dass Fotos und Videos nicht mehr als Beweis für die Echtheit etwas Vertrauen schenken könnten – und die damals eingesetzten Modelle waren weniger fortgeschritten als Griffin.
Unternehmen improvisieren bereits ihre Verteidigung. Im Jahr 2025 markierte Kraken einen mutmaßlichen nordkoreanischen Bewerber, nachdem sein Sicherheitsteam spontane Fragen gestellt hatte, etwa die Vorlage eines Ausweisdokuments und die Nennung lokaler Restaurants. Der Kandidat geriet ins Straucheln.
Die eigenen Versuche von Decrypt, Tavus' Modelle zu testen, verliefen enttäuschend. Nach einiger Recherche stellte sich heraus, dass Griffin-Lite für Kunden nicht verfügbar ist; es ist als Forschungsvorschau einer kleinen Gruppe vertrauenswürdiger Tester vorbehalten, und das Unternehmen sagt, es arbeite an Kennzeichnungsfunktionen und mit KI-Sicherheitsorganisationen. Tavus sagt, Griffin benötige vor einer öffentlichen Veröffentlichung Sicherheitsmaßnahmen – die Form dieser Schutzvorkehrungen und der Zeitpunkt eines breiteren Zugangs sind die nächsten Entwicklungen, die zu beobachten sind.
Tavus sammelte im November 2025 eine Series B über 40 Millionen US-Dollar unter Führung von CRV. Das frühere System, das 2,4 % erreichte, kombinierte drei getrennte Modelle – eines jeweils für Visuals, Dialog und Wahrnehmung. Vertrauenswürdige Tester können Zugang zu Griffin-Lite beantragen, indem sie ein Formular auf der Tavus-Website ausfüllen.
Ursprünglich berichtet von Decrypt](https://decrypt.co/379975/tavus-griffin-ai-fools-people-video-thinking-human).