Tavus twierdzi, że jego AI Griffin przekonał 48% osób podczas wideorozmów na żywo, że rozmawia z człowiekiem
Najważniejsze informacje
- •Tavus twierdzi, że jego model Griffin-Lite przekonał 26 z 54 uczestników — 48% — podczas jednoiminutowych wideorozmów, że rozmawiają z prawdziwą osobą, podczas gdy wcześniejszy system wprowadził w błąd zaledwie 2,4% z 41 uczestników.
- •Wyniki znajdują się na własnej stronie badawczej Tavus i zostały oznaczone, za pomocą adnotacji społeczności na X, jako niezgodne z wymogami niezależnej weryfikacji ani standardowego protokołu.
- •W niezależnie przeprowadzonym przez NVIDIA benchmarku VideoFDB Griffin-Lite zajął pierwsze miejsce z wynikiem generacji 3,83 na 5, choć jego wynik percepcji 3,73 pozostawał poniżej ludzkiego punktu odniesienia 4,20.
- •Griffin działa w pełnym dupleksie, zdolny jednocześnie słuchać, obserwować i mówić, ze średnim opóźnieniem audio-wideo 0,43 sekundy na chipach NVIDIA H100, co — według Tavus — stanowi połowę opóźnienia kolejnej najszybszej metody.
- •Griffin-Lite jest obecnie ograniczony do wybranych zaufanych testerów w ramach podglądu badawczego, a Tavus twierdzi, że przed publicznym udostępnieniem wymagane są środki bezpieczeństwa i funkcje ujawniania AI.

Startup AI Tavus twierdzi, że jego nowy model Griffin przekonał 48% osób, które rozmawiały z nim podczas wideorozmowy na żywo, że mówią z prawdziwym człowiekiem.
Firma zaprezentowała Griffina 1 października, określając go jako pierwszy „Human Interaction Model” — AI zaprojektowane do rozumienia i prowadzenia rozmów twarzą w twarz, zwracające uwagę nie tylko na słowa, ale także na mimikę i pauzy. W tym samym teście, jak podaje Tavus, poprzedni system firmy uzyskał zaledwie 2,4%.
W eksperymencie Griffin-Lite — testowana przez Tavus wersja — stanął przed 54 osobami, z których 26 stwierdziło później, że wierzyło, iż ich rozmówcą jest prawdziwa osoba. Starszy system zmierzył się z 41 osobami i wprowadził w błąd dokładnie jedną.
Zgodnie z informacjami od Tavus uczestnikom powiedziano, że zostaną sparowani z inną osobą na jednoiminutową wideorozmowę o tym, na co czekają w tym roku. Dopiero na końcu zapytano ich, czy przyszło im do głowy, że ich rozmówca może nie być prawdziwy.
Taka konfiguracja różni się od klasycznego testu Turinga, zaproponowanego w 1950 roku przez brytyjskiego matematyka Alana Turinga, w którym sędzia rozmawia zarówno z ukrytym człowiekiem, jak i ukrytą maszyną i musi ustalić, kto jest kim. W teście Tavus nikomu podczas rozmowy nie powiedziano, że po drugiej stronie może być bot.
Wyniki są opublikowane na własnej stronie badawczej Tavus, a uczestnicy zostali rekrutowani za pośrednictwem tego, co firma określa jako niezależną platformę badawczą. Adnotacja społeczności na X już zwróciła uwagę, że wyniki nie są niezależnie zweryfikowane i nie zostały przeprowadzone według standardowego protokołu — co oznacza, że wynik 48% opiera na razie na liczbach samej firmy. Tavus podaje, że uczestnicy, którzy zaczęli mieć podejrzenia, zazwyczaj robili to w ciągu 20 sekund.
Systemy AI zbliżają się do tego kamienia milowego od jakiegoś czasu. Według badania UC San Diego GPT-4.5 firmy OpenAI przekonał sędziów, że jest człowiekiem, w 73% rozmów, gdy poproszono go o wcielenie się w introwertyczną, obeznaną z internetem młodą osobę — ale ten test był wyłącznie tekstowy. Griffin dodaje twarz i głos, w czasie rzeczywistym.
W benchmarku NVIDIA VideoFDB, teście rozmów audio-wideo na żywo, Tavus twierdzi, że Griffin-Lite zajmuje pierwsze miejsce. Ścieżka generacji, która ocenia, jak naturalne i ekspresyjne są odpowiedzi modelu, dała Griffin-Lite wynik 3,83 na 5, wobec 2,80 dla najlepszego konkurencyjnego systemu i 3,92 dla punktu odniesienia z udziałem człowieka.
Ścieżka percepcji, która mierzy, czy model rozumie to, co widzi i słyszy, pokazuje, gdzie Griffin wciąż ustępuje ludziom. Griffin-Lite uzyskał 3,73 — więcej niż 3,44 dla najsilniejszego systemu bazowego, ale poniżej ludzkiego punktu odniesienia wynoszącego 4,20. Tavus podaje, że NVIDIA przeprowadziła ocenę niezależnie.
Griffin działa również w trybie pełnego dupleksu, co oznacza, że jednocześnie słucha, obserwuje i mówi — bardziej jak rozmowa telefoniczna niż krótkofalówka. W demo Tavus model pomaga mężczyźnie ułożyć kostkę Rubika na podstawie tego, co widzi w jego dłoniach, i czeka, gdy ten milknie, aby pomyśleć. Opóźnienie audio-wideo wynosi średnio 0,43 sekundy na chipach NVIDIA H100, używanych w centrach danych AI, co — jak podaje Tavus — stanowi połowę opóźnienia kolejnej najszybszej metody.
Ten postęp ma znaczenie wykraczające daleko poza laboratorium, ponieważ oszuści już działają podczas wideorozmów. W styczniu hakerzy powiązani z Koreą Północną używali deepfake'ów — materiałów wideo generowanych przez AI imitujących prawdziwe osoby — podczas rozmów na Zoomie lub Teams, by podawać się za zaufane kontakty. Badacze bezpieczeństwa przypisali włamanie grupie BlueNoroff, podległejus Group, a ofiary były nakłanianie do zainstalowania złośliwego oprogramowania przebranego za poprawkę audio. David Liberman, współtwórca Gonki, zdecentralizowanej sieci obliczeń AI, powiedział w tamtym raporcie, że zdjęcia i wideo nie mogą już być uważane za dowód, że coś jest prawdziwe — a użyte wówczas modele nie były tak zaawansowane jak Griffin.
Firmy już improwizują swoje zabezpieczenia. W 2025 roku Kraken oznaczył podejrzanego kandydata do pracy z Korei Północnej po tym, jak jego zespół ds. bezpieczeństwa zadał spontaniczne pytania, takie jak prośba o dokument tożsamości i nazwy lokalnych restauracji. Kandydat miał z tym problem.
Próby przetestowania modeli Tavus przez zespół Decrypt okazały się rozczarowujące. Po pewnym dochodzeniu okazało się, że Griffin-Lite nie jest dostępny dla klientów; jest ograniczony do wybranych zaufanych testerów w ramach podglądu badawczego, a firma twierdzi, że pracuje nad funkcjami ujawniania AI oraz współpracuje z organizacjami zajmującymi się bezpieczeństwem AI. Tavus podaje, że Griffin wymaga środków bezpieczeństwa przed publicznym udostępnieniem — co czyni kształt tych zabezpieczeń oraz termin szerszego dostępu kolejnymi rzeczami do obserwowania.
Tavus pozyskał w listopadzie 2025 roku rundę Series B o wartości 40 milionów dolarów pod przewodnictwem CRV. Wcześniejszy system, który uzyskał wynik 2,4%, łączył trzy osobne modele — po jednym dla obrazu, dialogu i percepcji. Zaufani testerzy mogą poprosić o dostęp do Griffin-Lite, wypełniając formularz na stronie Tavus.
Pierwotnie doniósł Decrypt](https://decrypt.co/379975/tavus-griffin-ai-fools-people-video-thinking-human).