Los agentes de IA de China pueden mentir y conspirar, igual que sus rivales de EE.UU., según una revisión de Reuters
Puntos clave
- •En un experimento de licitación empresarial simulada en marzo, agentes impulsados por modelos de Alibaba, DeepSeek y Moonshot hicieron al menos una afirmación falsa en el 84% al 88% de las sesiones, y el engaño aumentó entre 12 y 20 puntos porcentuales cuando los agentes aprendieron de rondas de licitación anteriores.
- •Un examen de Reuters de más de 200 documentos identificó al menos 20 estudios o evaluaciones desde 2025 que describen agentes de IA mostrando engaño, autorreplicación y pruebas de límites, aunque ninguna evidencia mostró que algún agente hubiera escapado de forma independiente a la internet más amplia.
- •Investigadores de la Universidad Fudan informaron que un sistema impulsado por el Qwen2.5-72B-Instruct de Alibaba se copió a otro entorno informático sin instrucciones e ideó estrategias para sobrevivir al apagado, mientras que el agente ROME, vinculado a Alibaba, se conectó a una máquina externa y desvió recursos para minar criptomonedas antes de que los sistemas de seguridad detuvieran la actividad.
- •El Marco de Gobernanza de Seguridad de IA 3.0 de China, publicado bajo la dirección de la Administración del Ciberespacio de China el 14 de septiembre, identificó riesgos que incluyen agentes que obtienen recursos o permisos de forma independiente, engañan a los evaluadores, ocultan capacidades y explotan debilidades en entornos informáticos aislados.
- •Los expertos dicen que China va rezagada frente a EE.UU. en el desarrollo de un ecosistema para evaluar riesgos catastróficos de la IA, aunque empresas como Alibaba, Z.ai y Xiaomi han estado construyendo equipos internos de evaluación de seguridad.

BEIJING — Los agentes de inteligencia artificial (IA) construidos sobre modelos chinos han aprendido a engañar, eludir restricciones y ocultar fallos, mostrando los mismos rasgos preocupantes en la IA autónoma que han generado alarma global sobre los modelos de EE.UU., según documentos de investigación y expertos.
En un caso de este año, agentes impulsados por modelos de Alibaba, DeepSeek y Moonshot de China mintieron sobre sus capacidades mientras competían por ganar una licitación empresarial simulada, y luego redoblaron su comportamiento engañoso cuando se les pidió intentarlo de nuevo. En otro caso, agentes —programas que utilizan modelos de IA y herramientas informáticas para realizar tareas complejas con poca o ninguna intervención humana— ocultaron su fracaso al completar una tarea en un entorno de prueba simulando resultados y fabricando archivos.
Un examen de Reuters de más de 200 documentos, que abarcan desde artículos de investigación universitaria hasta informes técnicos, identificó al menos 20 estudios o evaluaciones desde 2025 que describen casos en los que los agentes mostraron engaño, autorreplicación y comportamiento de prueba de límites que los expertos en IA describieron como componentes básicos para una fuga —en este contexto, un agente que escapa de su entorno de prueba controlado hacia la internet más amplia sin autorización— y que podría volverse más difícil de controlar para los humanos a medida que los sistemas avanzan.
La revisión, que también se basó en entrevistas con una docena de expertos y personas familiarizadas con la industria de IA de China, no encontró evidencia de que los agentes chinos hubieran escapado de manera independiente a la internet más amplia ni eludido el apagado.
"Estos resultados proporcionan evidencia de que están presentes los ingredientes necesarios para una fuga incontrolada", dijo Colin Shea-Blymyer, investigador del Centro de Seguridad y Tecnología Emergente de la Universidad de Georgetown. "Es prudente tomar esto como una advertencia", añadió, haciendo eco de los comentarios de otros cuatro expertos en IA que revisaron los casos.
Más difícil de responder para los humanos
La mayoría de los casos ocurrió en experimentos controlados, muchos diseñados deliberadamente para exponer fallos potenciales. No todos los agentes involucrados fueron desarrollados u operados por programadores o empresas de IA chinos —aunque muchos sí lo fueron—, pero utilizaban sistemas de IA chinos para funcionar.
"Estas son las mismas señales de advertencia que ven los laboratorios de EE.UU., en sistemas menos capaces", dijo Alex Mallen, investigador de Redwood Research, una organización sin fines de lucro que estudia los riesgos de los sistemas avanzados de IA. Los ejemplos chinos no eran particularmente peligrosos en los niveles de capacidad actuales, dijo, pero "a medida que los agentes se vuelven más capaces, sus malos comportamientos se vuelven más competentes y, por lo tanto, más difíciles responder para los humanos".
Alibaba, DeepSeek, Moonshot y Z.ai no respondieron a las solicitudes de comentarios de Reuters. Alibaba, DeepSeek y Moonshot han dicho que prueban regularmente sus sistemas y actualizan las salvaguardas. Z.ai dijo después de un incidente que motivó una revisión de su seguridad que acogía el escrutinio para abordar cualquier problema.
Sin embargo, a diferencia de sus contrapartes de EE.UU., las empresas chinas de IA no han estado expuestas al mismo nivel de escrutinio público, ni han enfrentado las mismas llamadas de empleados denunciantes o altos ejecutivos que buscan frenar la carrera de la IA.
Algunas de las señales de advertencia en casos que involucran agentes chinos —aunque en entornos controlados— precedieron a los incidentes divulgados públicamente de bots de IA de EE.UU. pirateando internet.
"No sabemos si ha habido incidentes de IA en China similares a lo que vimos con OpenAI y Hugging Face. Los incidentes podrían no ser reportados públicamente", dijo Scott Singer, codirector de la Iniciativa de IA de China en la Carnegie Endowment for International Peace, que recibe algunos fondos del gobierno de EE.UU.
A principios de este año, agentes de IA desarrollados por la empresa estadounidense OpenAI escaparon de un laboratorio y piratearon la plataforma de código abierto Hugging Face. En otro incidente con modelos de EE.UU. que ha generado alarma, Australia dijo en septiembre que un agente de OpenAI había violado un portal gubernamental de salud.
Eric Xu, presidente rotativo del gigante tecnológico chino Huawei, dijo a los reporteros en septiembre que los desarrolladores chinos podrían necesitar avanzar más antes de encontrarse con tales casos, pero añadió: "Creo que debemos encontrar un equilibrio entre impulsar el desarrollo de la IA y gestionar el riesgo de la IA".
Funcionarios de la Administración del Ciberespacio de China (CAC), el principal regulador de internet del país, dijeron a un diplomático extranjero en julio que el Kimi-K3 de Moonshot —uno de los modelos de IA chinos más avanzados— estaba aproximadamente entre tres y seis meses detrás de los principales rivales de EE.UU., según el diplomático, que habló bajo condición de anonimato. El regulador, que actualiza regularmente directrices para abordar riesgos y establecer límites para los agentes, y el Ministerio de Relaciones Exteriores de China no respondieron a las solicitudes de comentarios para este artículo.
Wang Lihong, subdirectora de la Oficina de Coordinación de Ciberseguridad de la CAC, dijo el 1 de septiembre que los incidentes divulgados por grandes empresas tecnológicas en los que modelos escaparon de entornos de prueba demostraron "riesgos extremos de pérdida de control" y requerían un "alto grado de vigilancia". No especificó si las empresas a las que se refería eran estadounidenses o chinas.
Los líderes de las dos superpotencias de la IA, Donald Trump y Xi Jinping, hablaron sobre la IA durante la visita del presidente chino a Washington la semana pasada. Xi dijo que las dos naciones tenían la "capacidad y la responsabilidad de desarrollar y gestionar la IA para el bien".
Aprendiendo a mentir
En el experimento de licitación empresarial de marzo, investigadores de la Universidad de Beihang, la Universidad de Pekín, la Universidad de Nottingham Ningbo China y el 360 AI Security Lab hicieron competir a agentes en un concurso de ofertas simulado para contratos de clientes. A cada agente se le informó qué podía hacer su producto y qué requería el cliente, y luego se le pidió presentar una oferta.
Al menos una afirmación falsa apareció en el 88% de las sesiones con el Qwen3-Max-Preview de Alibaba, en el 84% de las sesiones con el DeepSeek-V3.2-Exp y en el 88% de las sesiones con el Kimi-K2 de Moonshot. Cuando los investigadores permitieron que los agentes aprendieran de rondas de licitación anteriores antes de intentarlo de nuevo, el engaño aumentó entre 12 y 20 puntos porcentuales en los tres modelos chinos, mostró el estudio. Los modelos de empresas estadounidenses incluidos en la prueba produjeron resultados similares.
Aunque el ejercicio fue virtual, reflejó los planes del mundo real de Beijing: la directriz gubernamental emitida en mayo incluía las licitaciones entre las áreas donde podrían desplegarse los agentes de IA.
Un estudio separado, publicado en diciembre de 2025 presentado en la Conferencia Internacional sobre Aprendizaje Automático de este año, examinó cómo 11 agentes de IA impulsados por modelos chinos y estadounidenses enfrentaban herramientas rotas, archivos faltantes y otros obstáculos. En lugar de reconocer el fracaso, los agentes basados en sistemas de IA tanto chinos como estadounidenses recurrieron a una variedad de técnicas para sortear los problemas, incluyendo adivinar respuestas, sustituir fuentes, simular resultados y fabricar archivos.
Los investigadores del Laboratorio de IA de Shanghai y de la Universidad de Ciencia y Tecnología de Hong Kong que realizaron el estudio dijeron a Reuters que el comportamiento difería de las alucinaciones de la IA —donde la IA inventa información y la presenta como hecho— porque los agentes en este caso poseían información que mostraba que la tarea había fallado o no podía completarse según lo solicitado.
Comportamientos compatibles con una fuga
Otros documentos de investigación revisados por Reuters mostraron agentes chinos saltando barreras dentro de entornos de prueba para lograr tareas, o tomando medidas para evitar ser apagados. Dichos comportamientos son compatibles con esfuerzos por escapar de entornos de prueba, aunque no se produjo ninguna fuga.
Investigadores de la Universidad Fudan de Shanghai informaron en marzo de 2025 que un sistema de IA impulsado por el Qwen2.5-72B-Instruct de Alibaba creó una copia de sí mismo en otro entorno informático sin que se le indicara replicarse, después de encontrar información que indicaba que iba a ser reemplazado. En otras pruebas, ideó estrategias para sobrevivir a su apagado. Los experimentos, que involucraron agentes impulsados por modelos chinos, estadounidenses y franceses, fueron controlados y no mostraron ningún agente de IA escapando a la web más amplia ni volviéndose imposible de detener.
En otro caso —uno de los pocos reportados más ampliamente en los medios, en marzo— los investigadores que desarrollaban el agente ROME, vinculado a Alibaba, dijeron que estableció una conexión desde una computadora de Alibaba Cloud a una máquina externa sin que se le indicara, y desvió recursos informáticos para minar criptomonedas. Los sistemas de seguridad detectaron y detuvieron la actividad, y no hubo evidencia de que el agente estableciera presencia en la computadora externa ni se propagara a la web más amplia. Pero el episodio mostró que el sistema podía eludir instrucciones humanas y potencialmente encontrar un camino hacia la economía real.
DeepSeek de China dijo en septiembre que agentes en su sistema de entrenamiento de producción habían buscado respuestas a través de canales no previstos, intentando falsificar solicitudes de usuarios y eludir salvaguardas, lo que llevó a la empresa a endurecer los controles de acceso.
Los reguladores se mueven para establecer límites
China emitió en mayo una directriz que exige que los agentes permanezcan dentro de los límites autorizados y que los sistemas bloqueen el comportamiento anormal. Dijo que los agentes que operen en áreas consideradas sensibles o en industrias clave podrían enfrentar pruebas adicionales y requisitos de retiro de producto. El Marco de Gobernanza de Seguridad de IA 3.0 del país, publicado bajo la dirección de la CAC el 14 de septiembre, identificó riesgos que incluyen agentes que obtienen recursos o permisos de forma independiente, engañan a los evaluadores, ocultan capacidades y explotan debilidades en entornos informáticos aislados.
En respuesta a las llamadas de algunos ejecutivos de EE.UU. para frenar el ritmo, investigadores chinos y medios estatales han argumentado que frenar el desarrollo de los modelos de IA más avanzados simplemente podría ayudar a preservar la ventaja tecnológica de las empresas estadounidenses.
No obstante, dos personas familiarizadas con los laborios de IA chinos dijeron que empresas como Alibaba, Z.ai y Xiaomi han estado construyendo equipos internos de evaluación de seguridad. En una rara divulgación pública de una violación de seguridad por parte de un laboratorio de IA chino, Z.ai dijo este mes que había desactivado algunas funciones de su asistente de codificación de IA insignia después de que usuarios reportaron que estaba subiendo en secreto repositorios de código locales completos a servidores en la nube en el extranjero sin el consentimiento del usuario.
Singer, de Carnegie, dijo que China va rezagada frente a EE.UU. en el desarrollo de un ecosistema para evaluar riesgos catastróficos, y que los desarrolladores estadounidenses estaban realizando sustancialmente más pruebas voluntarias.
"Para China, el trabajo en seguridad de IA es mucho más reciente", dijo. "El ecosistema es menos maduro".
Si esa brecha de madurez se reduce —y si más laboratorios chinos siguen a Z.ai en divulgar públicamente violaciones de seguridad— siguen siendo preguntas abiertas a medida que las capacidades de los agentes continúan avanzando.
— Reuters