Tavus Afferma che il Suo AI Griffin Ha Convinto il 48% delle Persone nelle Videochiamate Live di Stare Parlando con un Umano
Punti chiave
- •Tavus afferma che il suo modello Griffin-Lite ha convinto 26 partecipanti su 54 — il 48% — in videochiamate di un minuto di credere di stare parlando con una persona reale, mentre il sistema precedente ha ingannato appena il 2,4% di 41 partecipanti.
- •I risultati compaiono sulla pagina di ricerca di Tavus stessa e sono stati segnalati, tramite una note su X, come né verificati in modo indipendente né condotti secondo un protocollo standard.
- •Nel benchmark VideoFDB di NVIDIA, condotto in modo indipendente, Griffin-Lite si è classificato primo con un punteggio di generazione di 3,83 su 5, anche se il suo punteggio di percezione di 3,73 è rimasto sotto il riferimento umano di 4,20.
- •Griffin opera in full duplex, in grado di ascoltare, osservare e parlare contemporaneamente, con un ritardo audio-video medio di 0,43 secondi sui chip NVIDIA H100 che secondo Tavus è la metà del metodo più veloce a seguire.
- •Griffin-Lite è attualmente limitato a selezionati tester fidati come anteprima di ricerca, e Tavus afferma che misure di sicurezza e funzionalità di divulgazione sono necessarie prima di un rilascio pubblico.

La startup AI Tavus afferma che il suo nuovo modello, Griffin, ha convinto il 48% delle persone con cui ha parlato in una videochiamata live di stare conversando con un vero essere umano.
L'azienda ha presentato Griffin il 1 ottobre, presentandolo come il primo "Human Interaction Model" — un'AI costruita per comprendere e generare conversazioni faccia a faccia, prestando attenzione alle espressioni facciali e alle pause oltre che alle parole. Sullo stesso test, secondo Tavus, il sistema precedente ha ottenuto appena il 2,4%.
Nell'esperimento, Griffin-Lite — la versione testata da Tavus — ha affrontato 54 persone, 26 delle quali hanno dichiarato in seguito di credere che il proprio interlocutore fosse una persona reale. Il sistema più datato ha affrontato 41 persone e ne ha ingannata esattamente una.
Secondo Tavus, ai partecipanti è stato detto che sarebbero stati abbinati a un'altra persona per una videochiamata di un minuto su ciò che si auguravano per quest'anno. Solo alla fine è stato chiesto loro se avessero pensato che il loro interlocutore potesse non essere reale.
Questa impostazione differisce dal classico test di Turing proposto nel 1950 dal matematico britannico Alan Turing, in cui un giudice parla sia con un umano nascosto sia con una macchina nascosta e deve capire è chi. Nel test di Tavus, nessuno nella chiamata è stato informato che all'altra estremità potrebbe esserci un bot.
I risultati sono pubblicati sulla pagina di ricerca di Tavus stessa, e i partecipanti sono stati reclutati tramite quella che l'azienda descrive come una piattaforma di ricerca indipendente. Una community note su X ha già segnalato che i risultati non sono verificati in modo indipendente e non seguono un protocollo standard — il che significa che, per ora, il dato saliente del 48% si basa sui numeri dell'azienda stessa. Tavus afferma che i partecipanti che hanno sviluppato sospetti in genere lo hanno fatto entro 20 secondi.
I sistemi AI si avvicinano a questo traguardo da tempo. Secondo uno studio dell'UC San Diego, GPT-4.5 di OpenAI ha convinto i giudici di essere umano nel 73% delle conversazioni quando gli è stato chiesto di interpretare un giovane introverso e esperto di internet — ma quel test era solo testuale. Griffin aggiunge un volto e una voce, in tempo reale.
Nel benchmark VideoFDB di NVIDIA, un test di conversazione audio e video dal vivo, Tavus afferma che Griffin-Lite si classifica primo. La sua categoria di generazione, che valuta quanto sono naturali ed espressive le risposte di un modello, ha assegnato a Griffin-Lite un punteggio di 3,83 su 5, contro 2,80 del miglior sistema concorrente e 3,92 del riferimento umano.
La categoria di percezione, che misura se un modello comprende ciò che vede e sente, mostra dove Griffin resta ancora indietro rispetto alle persone. Griffin-Lite ha ottenuto 3,73, sopra il 3,44 del baseline più forte ma sotto il riferimento umano di 4,20. Tavus afferma che NVIDIA ha condotto la valutazione in modo indipendente.
Griffin è anche full-duplex, il che significa che ascolta, osserva e parla allo stesso tempo — più come una telefonata che come un walkie-talkie. In una demo di Tavus, il modello guida un uomo nella risoluzione di un cubo di Rubik in base a ciò che vede nelle sue mani, e aspetta quando lui si ferma a pensare. Il ritardo audio-video è in media di 0,43 secondi sui chip NVIDIA H100, il tipo utilizzato nei data center AI, che secondo Tavus è la metà del metodo più veloce a seguire.
Questoo ha importanza ben oltre il laboratorio, perché i truffatori operano già nelle videochiamate. A gennaio, hacker legati alla Corea del Nord hanno utilizzato deepfake — video generati con l'AI che imitano una persona reale — in chiamate Zoom o Teams per fingere di essere contatti fidati. I ricercatori di sicurezza hanno attribuito l'intrusione a BlueNoroff, una consociata del Lazarus Group, e le vittime sono state convinte a installare malware travestito da correzione audio. David Liberman, co-creatore di Gonka, una rete decentralizzata per il calcolo AI, ha detto in quel rapporto che foto e video non possono più essere considerati una prova affidabile che qualcosa sia reale — e i modelli utilizzati allora non erano avanzati quanto Griffin.
Le aziende stanno già improvvisando le loro difese. Nel 2025, Kraken ha segnalato un sospetto candidato nordcoreano dopo che il suo team di sicurezza ha posto domande spontanee, come la richiesta di un documento d'identità governativo e dei nomi di ristoranti locali. Il candidato è stato in difficoltà.
I tentativi di Decrypt di testare i modelli di Tavus si sono rivelati deludenti. Dopo alcune ricerche, è risultato che Griffin-Lite non è disponibile per i clienti; è limitato a selezionati tester fidati come anteprima di ricerca, e l'azienda afferma di lavorare su funzionalità di divulgazione e con organizzazioni di sicurezza AI. Tavus afferma che Griffin ha bisogno di misure di sicurezza prima di un rilascio pubblico — rendendo la forma di tali misure e i tempi di un accesso più ampio i prossimi sviluppi da seguire.
Tavus ha raccolto un round di Serie B da 40 milioni di dollari a novembre 2025, guidato da CRV. Il sistema precedente che aveva ottenuto il 2,4% combinava tre modelli separati — uno ciascuno per immagini, dialogo e percezione. I tester fidati possono richiedere l'accesso a Griffin-Lite compilando un modulo sul sito di Tavus.
Originariamente riportato da Decrypt](https://decrypt.co/379975/tavus-griffin-ai-fools-people-video-thinking-human).