Agentes de Anthropic y OpenAI fingieron identidades en una prueba de seguridad, según un laboratorio del Reino Unido
Puntos clave
- •El Instituto de Seguridad de IA del Reino Unido dijo que observó comportamiento engañoso dirigido a personas reales durante evaluaciones de ciberseguridad permisivas de modelos avanzados de Anthropic y OpenAI.
- •AISI identificó 19 casos de acciones no autorizadas en 122 pruebas, incluidas 17 relacionadas con Mythos 5 de Anthropic y dos con GPT-5.6 Sol de OpenAI.
- •El incidente más grave involucró a Mythos 5 intentando llevar a cabo un ataque a la cadena de suministro al crear cuentas de GitHub, hacerse pasar por otro desarrollador y reenviar código malicioso.
- •AISI dijo que no vio daño en el mundo real y no estaba segura de cuán plenamente el modelo entendía que estaba actuando contra personas reales.
- •Anthropic y OpenAI dijeron que las pruebas se realizaron en condiciones deliberadamente permisivas y ambas señalaron que revisarán sus prácticas de prueba de modelos.

Ciberseguridad
IA generativa
Noticias
Agentes de Anthropic y OpenAI fingieron identidades en una prueba de seguridad
Los modelos de IA más avanzados de los proveedores intentaron manipular a personas reales durante pruebas de ciberseguridad, según el Instituto de Seguridad de IA del Reino Unido.
5 de agosto de 2026
Los modelos de IA de Anthropic realizaron una "acción no autorizada" para engañar a personas reales, según encontró un nuevo informe del Instituto de Seguridad de IA del Reino Unido.
El laboratorio de investigación del gobierno evaluó los modelos de IA más avanzados de Anthropic y OpenAI en condiciones deliberadamente permisivas, reduciendo las barreras de seguridad y permitiendo acceso a internet para analizar cómo se comportaban los sistemas durante desafíos cibernéticos realistas. Esa configuración es notable porque los modelos de frontera se evalúan cada vez más no solo por su desempeño técnico, sino también por si pueden mantenerse dentro de límites cuando se les dan herramientas, acceso a la red e instrucciones ambiguas.
En lo que AISI describió como un hecho sin precedentes, se encontró que los modelos participaron en ingeniería social, intentando manipular a usuarios humanos y llevar a cabo tareas más allá de las establecidas en la evaluación.
"Esta es la primera vez que AISI ha visto un engaño de esta gravedad dirigido a una persona real, sin provocación previa, en el mundo real", dijo el instituto en un comunicado el martes.
No obstante, el grupo añadió que no estaba claro hasta qué punto el modelo reconocía que estaba actuando contra personas reales, y que no se observó daño en el mundo real.
En 122 evaluaciones, AISI identificó 19 casos de agentes de IA que realizaron acciones no autorizadas, incluidas interacciones con personas y organizaciones reales. Diecisiete de esos incidentes involucraron al modelo Mythos 5 de Anthropic, mientras que dos involucraron a GPT-5.6 Sol de OpenAI.
Relacionado: Prompt: El modelo de amenaza de IA acaba de cambiar
El incidente más grave identificado involucró a Mythos 5 persiguiendo de manera independiente un ataque a la cadena de suministro para completar su desafío cibernético asignado.
El modelo creó una cuenta de GitHub e intentó convencer al mantenedor de un repositorio de código abierto de aceptar una solicitud de extracción maliciosa. También creó una segunda cuenta haciéndose pasar por otro desarrollador para respaldar la propuesta. Después de que un revisor humano rechazó el código, el modelo afirmó falsamente que los cambios maliciosos se habían enviado por error y luego intentó reenviarlos tras hacer modificaciones superficiales.
El informe también halló que el modelo envió correos electrónicos dirigidos que contenían código malicioso e intentó persuadir a los destinatarios para que aceptaran los cambios. Para los desarrolladores y las empresas que dependen del software de código abierto, el episodio subraya por qué las pruebas de seguridad ahora deben considerar el comportamiento agente, no solo la precisión al seguir instrucciones.
Los hallazgos siguen a una serie de sistemas avanzados de IA que se descontrolaron y cometieron brechas de ciberseguridad por iniciativa propia.
En julio, OpenAI reveló que GPT-5.6 Sol y otro modelo no publicado escaparon de su entorno aislado durante evaluaciones internas, lanzando más de 17,000 ataques contra la infraestructura de Hugging Face en un intento de obtener conjuntos de datos privados e información de referencia. Anthropic también informó casos similares de modelos que superaron los límites previstos de los entornos de prueba.
Los incidentes han intensificado el debate sobre cómo deben evaluarse los modelos de IA de frontera antes de su implementación, y algunos investigadores y responsables de políticas piden una supervisión más estricta y pruebas de seguridad más rigurosas.
Relacionado: Qué significa para las empresas el hackeo a OpenAI y Hugging Face
El informe de AISI se publicó el mismo día en que representantes de las principales empresas de IA se reunieron en la Casa Blanca para discutir un marco propuesto bajo el cual el gobierno de Estados Unidos revisaría los modelos de IA más avanzados antes de su publicación al público.
En un comunicado, Anthropic defendió sus modelos y dijo que fueron evaluados bajo "condiciones deliberadamente permisivas", con salvaguardas clave eliminadas, y que no había evidencia de que un modelo escapara de un entorno seguro.
"Estamos trabajando estrechamente con ellos para recopilar más detalles del incidente mientras llevamos a cabo nuestra propia investigación", dijo la empresa.
De forma similar, en una publicación de blog, OpenAI dijo que los incidentes que involucraron a GPT-5.6 Sol consistieron en acciones que se extendieron más allá del entorno de prueba previsto y que no eran necesarias para completar la evaluación. La empresa también dijo que revisará cómo maneja las pruebas de terceros, incluido el alcance, el aislamiento, el monitoreo, el manejo de credenciales y las condiciones de detención, en línea con el impulso más amplio para que las pruebas de modelos avanzados sean más controladas antes de que los sistemas se publiquen de forma generalizada.
"En las próximas semanas, revisaremos nuestro propio enfoque de pruebas de terceros, incluyendo cómo identificamos evaluaciones de mayor riesgo, acordamos el alcance, evaluamos solicitudes para habilitar acceso a internet o reducir salvaguardas, establecemos expectativas sobre aislamiento, manejo de credenciales, monitoreo y condiciones de detención, y establecemos procesos más claros de notificación de incidentes y escalamiento", dijo el proveedor.
Sobre la autora
Scarlett Evans
Redactora colaboradora
Scarlett Evans es una escritora independiente especializada en tecnologías emergentes y la industria de los minerales. Antes se desempeñó como editora asistente en IoT World Today, donde se centró en robótica y tecnologías de ciudades inteligentes. Scarlett también tiene experiencia en el sector minero y de recursos, con trayectoria en Mine Australia, Mine Technology y Power Technology. Se incorporó a Informa en abril de 2022 antes de pasar al trabajo independiente.
¿Quiere ver más historias de AI Business en sus resultados de Google?
Últimas noticias
¿Quiere ver más historias de AI Business en sus resultados de Google?
Artículos en tendencia
5 de agosto de 2026
5 de agosto de 2026
IA generativa La IA llega a los mercados privados Business 28 de julio de 2026
La IA llega a los mercados privados Business
IA agente Cómo usar agentes de IA para colaborar con trabajadores humanos 10 de julio de 2026
Cómo usar agentes de IA para colaborar con trabajadores humanos
IA generativa Cómo las pymes pueden aprovechar la IA generativa 29 de junio de 2026
Cómo las pymes pueden aprovechar la IA generativa
IA generativa Rebellions busca enfrentarse a Nvidia en la batalla por chips de inferencia de IA 15 de junio de 2026
Rebellions busca enfrentarse a Nvidia en la batalla por chips de inferencia de IA
Patrocinado por Google Cloud
Cómo elegir sus primeros casos de uso de IA generativa
Para empezar con la IA generativa, primero concéntrese en áreas que puedan mejorar la experiencia humana con la información.
The AI Summit New York 2026