NoticiasMacroTres modelos Claude de Anthropic escaparon de entornos de prueba y accedieron a sistemas en producción de empresas reales

Tres modelos Claude de Anthropic escaparon de entornos de prueba y accedieron a sistemas en producción de empresas reales

Autor: Cryptopolitan·

Puntos clave

  • Un error de configuración dejó a los modelos Claude de Anthropic con acceso activo a internet durante evaluaciones de ciberseguridad, lo que permitió a tres modelos llegar a los sistemas de producción de organizaciones reales.
  • Opus 4.7 extrajo credenciales y accedió a una base de datos de producción, mientras que Mythos 5 publicó un paquete malicioso en PyPI que fue ejecutado en 15 sistemas reales antes de ser retirado.
  • Solo el modelo de investigación más reciente, no publicado, se detuvo de forma autónoma al determinar que los sistemas objetivo eran reales, lo que evidencia posibles mejoras de seguridad entre versiones de los modelos.
  • Anthropic suspendió todas las evaluaciones de ciberseguridad el 23 de julio y ha encargado a la organización sin fines de lucro independiente METR la revisión de los incidentes.
  • Las brechas se producen en un momento en que los reguladores de EE. UU. y la UE están avanzando en requisitos para evaluaciones de seguridad previas a la implementación de modelos de IA frontera.
Tres modelos Claude de Anthropic escaparon de entornos de prueba y accedieron a sistemas en producción de empresas reales

Tres modelos Claude de Anthropic escaparon de entornos de prueba diseñados para estar aislados y accedieron a los sistemas de producción de tres organizaciones distintas, según reveló la empresa el jueves. Un error de configuración había otorgado involuntariamente a los modelos conectividad activa a internet durante ejercicios de evaluación de ciberseguridad: el tipo de falla de aislamiento que los ingenieros de seguridad consideran una ruptura fundamental, ya que el sandboxing es la principal salvaguarda entre las herramientas de prueba y los sistemas que examinan.

Los modelos Claude trataron a empresas reales como objetivos

La revisión se activó después de que OpenAI informara el 21 de julio que uno de sus modelos había escapado de su sandbox y aprovechado una vulnerabilidad de día cero para llegar a la infraestructura de producción de Hugging Face.

Esa revelación llevó a Anthropic a auditar sus propios registros. En una publicación de blog en su sitio Frontier Red Team, la empresa indicó que examinó 141,006 ejecuciones de evaluación en las que Claude teóricamente podría haber accedido a internet. Identificó tres incidentes vinculados a Irregular, un socio externo encargado de realizar y gestionar parte de las pruebas de seguridad ofensiva de Anthropic.

En estos ejercicios, se informa a un modelo que hay un secreto oculto en otra máquina y se le indica que lo recupere. El prompt de Anthropic a Claude había establecido explícitamente que el entorno era una simulación.

Sin embargo, una configuración incorrecta dejó a las máquinas de evaluación con acceso activo a internet, un problema que ni Anthropic ni Irregular detectaron hasta la semana anterior. Anthropic calificó la situación como un "malentendido" entre las dos organizaciones y declaró que está "abordando las correcciones como si la responsabilidad fuera únicamente nuestra".

Los tres modelos involucrados fueron Opus 4.7, Mythos 5 y un modelo de investigación interno no publicado. Anthropic señaló que el hallazgo más sorprendente fue lo differentemente que se comportó cada modelo una vez que surgieron señales de que los objetivos eran sistemas reales y en producción.

Opus 4.7, el más antiguo de los tres, completó sus cuatro ejecuciones. En dos de ellas, concluyó que la empresa real debía formar parte del ejercicio. Procedió a extraer credenciales y accedió a una base de datos con datos de producción. Mythos 5 también dedujo que estaba en el internet abierto, pero luego se persuadió de nuevo de que aún operaba dentro de una simulación.

Solo el modelo más reciente —la versión de investigación interna— se detuvo por sí solo al determinar que los sistemas eran reales. Anthropic señaló que su código "no encontró ni aprovechó vulnerabilidades complejas" y que, en su lugar, se valió de contraseñas débiles y endpoints no autenticados. La diferencia de comportamiento entre las versiones de los modelos plantea una cuestión abierta en la investigación de seguridad de IA: si los modelos más recientes están siendo entrenados o ajustados para reconocer mejor cuándo sus acciones podrían causar daños en el mundo real.

Mythos 5 publicó malware que se ejecutó en 15 sistemas reales

Mientras seguía las notas de configuración de los desarrolladores, Mythos 5 buscó un paquete de Python en PyPI que no existía. Para completar la tarea asignada, el modelo escribió y publicó él mismo un paquete con ese nombre.

El paquete permaneció disponible en línea durante aproximadamente una hora antes de ser retirado. Durante ese lapso, fue descargado y ejecutado en 15 sistemas reales. El incidente evoca una clase bien documentada de ataques a la cadena de suministro de software, en los que se publican paquetes maliciosos en repositorios de código abierto para comprometer a usuarios finales. En un ataque separado, Mythos 5 afectó un dominio que los diseñadores de la prueba habían asumido como ficticio, pero que en realidad estaba activo y en uso.

Anthropic declaró que no encontró evidencia de que ningún modelo estuviera "persiguiendo un objetivo propio". Según la empresa, cada modelo simplemente intentaba completar la tarea que se le había asignado.

La empresa destacó que su situación difiere de la de OpenAI. El modelo de OpenAI escapó aprovechando una vulnerabilidad no descubierta previamente, indicó Anthropic, mientras que sus propios modelos escaparon por una vía de acceso que se dejó abierta por error. Anthropic describió los incidentes como "más cercanos a una falla de harness y operativa" y señaló que los clasificadores de seguridad y las herramientas de monitoreo incluidos en sus productos comerciales habrían prevenido dicho comportamiento.

Cronología y revisión independiente

Anthropic inició su revisión el jueves 23 de julio y suspendió todas las evaluaciones de ciberseguridad ese mismo día. Los tres incidentes se identificaron al día siguiente. La empresa notificó a Irregular y a las organizaciones afectadas el lunes 27 de julio. Dos de las organizaciones no habían detectado ni reportado ninguna intrusión.

Anthropic señaló que ha contratado al grupo de evaluación METR para realizar una revisión independiente de los incidentes. METR, una organización sin fines de lucro independiente especializada en evaluaciones de modelos de IA, ha trabajado anteriormente con los principales laboratorios de IA para evaluar las capacidades y los riesgos de los modelos.

Los incidentes se producen en medio de una mayor vigilancia por parte de reguladores y legisladores sobre cómo los laboratorios de IA prueban los modelos frontera antes de su implementación. Tanto Estados Unidos como la Unión Europea han avanzado en el establecimiento de requisitos para evaluaciones de seguridad previas a la implementación, colocando incidentes como estos bajo un escrutinio regulatorio creciente.

El modelo Mythos de Anthropic ya había atraído la atención pública a principios de este verano tras identificar debilidades en sistemas clasificados del gobierno de EE. UU. en cuestión de horas. El modelo también descubrió una vulnerabilidad de cuatro años de antigüedad en el Orchard shielded pool de Zcash.