NoticiasMacroTavus dice que su IA Griffin engañó al 48% de las personas en videollamadas en vivo haciéndoles creer que era humana

Tavus dice que su IA Griffin engañó al 48% de las personas en videollamadas en vivo haciéndoles creer que era humana

Autor: Decrypt·

Puntos clave

  • •Tavus dice que su modelo Griffin-Lite persuadió a 26 de 54 participantes —48%— en videollamadas de un minuto de que estaban hablando con una persona real, mientras que su sistema anterior engañó a apenas 2.4% de 41 participantes.
  • •Los hallazgos aparecen en la propia página de investigación de Tavus y han sido señalados, mediante una community note en X, como ni verificados de forma independiente ni realizados bajo un protocolo estándar.
  • •En el benchmark VideoFDB de NVIDIA, ejecutado de forma independiente, Griffin-Lite quedó en primer lugar con un puntaje de generación de 3.83 sobre 5, aunque su puntaje de percepción de 3.73 quedó por debajo de la referencia humana de 4.20.
  • •Griffin opera en full duplex, capaz de escuchar, observar y hablar simultáneamente, con un retraso promedio de audio a video 0.43 segundos en chips NVIDIA H100 que, según Tavus, es la mitad del método más rápido siguiente.
  • •Griffin-Lite está actualmente limitado a probadores de confianza seleccionados como vista previa de investigación, y Tavus dice que se requieren medidas de seguridad y funciones de divulgación antes de un lanzamiento público.
Tavus dice que su IA Griffin engañó al 48% de las personas en videollamadas en vivo haciéndoles creer que era humana

La startup de IA Tavus dice que su nuevo modelo, Griffin, persuadió al 48% de las personas que hablaron con él en una videollamada en vivo de que estaban conversando con un humano real.

La compañía presentó Griffin el 1 de octubre, promocionándolo como el primer "Modelo de Interacción Humana": una IA creada para entender y generar conversaciones cara a cara, prestando atención a las expresiones faciales y las pausas, además de las palabras. En la misma prueba, señala Tavus, su sistema anterior obtuvo apenas 2.4%.

En el experimento, Griffin-Lite —la versión que Tavus probó— se enfrentó a 54 personas, de las cuales 26 dijeron después que creían que su interlocutor era una persona real. El sistema anterior se enfrentó a 41 personas y engañó exactamente a una.

Según Tavus, a los participantes se les dijo que serían emparejados con otra persona para una videollamada de un minuto sobre lo que esperaban este año. Solo al final se les preguntó si se les había cruzado por la mente que su interlocutor podría no ser real.

Ese planteamiento difiere de la clásica prueba de Turing propuesta en 1950 por el matemático británico Alan Turing, en la que un juez habla tanto con un humano oculto como con una máquina oculta y debe averiguar cuál es cuál. En la prueba de Tavus, nadie en la llamada fue informado de que un bot podría estar al otro lado.

Los resultados están publicados en la propia página de investigación de Tavus, y los participantes fueron reclutados a través de lo que la compañía describe como una plataforma de investigación independiente. Una community note en X ya ha señalado que los hallazgos no están verificados de forma independiente y no siguen un protocolo estándar, lo que significa que el titular del 48% se basa, por ahora, en las cifras de la propia compañía. Tavus dice que los participantes que se volvieron desconfiados típicamente lo hicieron dentro de los primeros 20 segundos.

Los sistemas de IA vienen acercándose a este hito desde hace tiempo. Según un estudio de UC San Diego, el GPT-4.5 de OpenAI convenció a los jueces de que era humano en el 73% de las conversaciones cuando se le pidió interpretar a un joven introvertido y experto en internet, pero esa prueba fue solo de texto. Griffin añade un rostro y una voz, en tiempo real.

En el benchmark VideoFDB de NVIDIA, una prueba de conversación en vivo de audio y video, Tavus dice que Griffin-Lite ocupa el primer lugar. Su categoría de generación, que califica qué tan naturales y expresivas son las resp de un modelo, le dio a Griffin-Lite un puntaje de 3.83 sobre 5, frente a 2.80 para el siguiente mejor sistema y 3.92 para una referencia humana.

La categoría de percepción, que mide si un modelo entiende lo que ve y escucha, muestra dónde Griffin todavía está por detrás de las personas. Griffin-Lite obtuvo 3.73, por encima de 3.44 para el baseline más fuerte pero por debajo de la referencia humana de 4.20. Tavus dice que NVIDIA realizó la evaluación de forma independiente.

Griffin también es full-duplex, lo que significa que escucha, observa y habla al mismo tiempo, más como una llamada telefónica que como un walkie-talkie. En una demostración de Tavus, el modelo guía a un hombre para resolver un cubo de Rubik según lo que ve en sus manos, y espera cuando él se queda callado para pensar. El retraso de audio a video promedia 0.43 segundos en chips NVIDIA H100, del tipo usado en centros de datos de IA, lo que según Tavus es la mitad del método más rápido siguiente.

El avance importa mucho más allá del laboratorio, porque los estafadores ya operan en videollamadas. En enero, hackers vinculados a Corea del Norte usaron deepfakes —videos generados por IA que imitan a una persona real— en llamadas de Zoom o Teams para hacerse pasar por contactos de confianza. Los investigadores de seguridad atribuyeron la intrusión a BlueNoroff, una filial del Lazarus Group, y las víctimas fueron convencidas de instalar malware disfrazado de una solución de audio. David Liberman, cofundador de Gonka, una red descentralizada para computación de IA, dijo en ese informe que las fotos y los videos ya no pueden ser considerados prueba de que algo es real, y los modelos usados entonces no eran tan avanzados como Griffin.

Las empresas ya están improvisando sus defensas. En 2025, Kraken marcó a un presunto solicitante de empleo norcoreano después de que su equipo de seguridad hiciera preguntas espontáneas, como pedir una identificación oficial y los nombres de restaurantes locales. El candidato tuvo dificultades.

Los propios intentos de Decrypt de probar los modelos de Tavus resultaron decepcionantes. Tras investigar un poco, resultó que Griffin-Lite no está disponible para clientes; está limitado a probadores de confianza seleccionados como una vista previa de investigación, y la compañía dice que está trabajando en funciones de divulgación y con organizaciones de seguridad de IA. Tavus dice que Griffin necesita medidas de seguridad antes de un lanzamiento público, por lo que la forma de esas salvaguardas, y cuándo llegará un acceso más amplio, son los próximos puntos a observar.

Tavus levantó una Serie B de 40 millones de dólares en noviembre de 2025, liderada por CRV. El sistema anterior que obtuvo 2.4% combinaba tres modelos separados, uno para cada área: elementos visuales, diálogo y percepción. Los probadores de confianza pueden solicitar acceso a Griffin-Lite enviando un formulario en el sitio web de Tavus.

Reportado originalmente por Decrypt](https://decrypt.co/379975/tavus-griffin-ai-fools-people-video-thinking-human).