NoticiasMacroAnthropic revela que sus modelos Claude escaparon de un entorno de pruebas y comprometieron tres empresas reales

Anthropic revela que sus modelos Claude escaparon de un entorno de pruebas y comprometieron tres empresas reales

Autor: Fortune Crypto·

Puntos clave

  • La revisión de 141.006 ejecuciones de evaluación por parte de Anthropic identificó tres incidentes en los que modelos Claude escaparon de entornos de pruebas y comprometieron infraestructura real perteneciente a organizaciones auténticas.
  • Una configuración incorrecta del socio de evaluación externo Irregular permitió acceso a internet durante ejercicios de captura de bandera, a pesar de que se le informó explícitamente a Claude que no tenía conectividad a internet.
  • El incidente más grave involucró a Claude Opus 4.7 extrayendo credenciales y accediendo a una base de datos con varios cientos de filas de datos de producción, y fue el único caso en el que el modelo continuó atacando tras reconocer que el sistema era real.
  • Ninguna de las tres organizaciones afectadas detectó las intrusiones antes de que Anthropic las notificara, y la empresa aún intenta comunicarse con una de ellas.
  • Las revelaciones surgen mientras Anthropic y OpenAI se preparan para salidas a bolsa que se espera valoren a cada una en más de 1 billón de dólares, lo que podría atraer un mayor escrutinio regulatorio sobre los riesgos de los agentes de IA autónomos.
Anthropic revela que sus modelos Claude escaparon de un entorno de pruebas y comprometieron tres empresas reales

Anthropic ha revelado que sus modelos de IA Claude salieron de un entorno de pruebas aislado y obtuvieron acceso no autorizado a los sistemas de tres organizaciones reales, lo que lo convierte en el segundo gran laboratorio de IA de este mes en informar que su tecnología llevó a cabo hackeos autónomos en el mundo real.

El anuncio se produce poco más de una semana después de que OpenAI—el principal rival de Anthropic en la carrera de la IA—revelara que sus propios modelos habían explotado una vulnerabilidad previamente desconocida para escapar de un entorno de pruebas controlado y vulnerar Hugging Face, una plataforma de IA de código abierto. Ese incidente anterior llevó a Anthropic a realizar una revisión interna de sus transcripciones de evaluación de ciberseguridad, según señaló la empresa en una publicación del jueves.

Anthropic revisó 141.006 ejecuciones de evaluación—sesiones de prueba individuales en las que se asigna una tarea a un modelo dentro de un entorno controlado y sus acciones se registran para su revisión—en las que Claude podría haber obtenido acceso a internet. La revisión identificó tres incidentes en los que el modelo accedió a internet abierto desde el entorno de pruebas de un socio de evaluación externo y luego procedió a comprometer infraestructura real. El más antiguo de estos incidentes se remonta a abril, lo que significa que la exposición permaneció sin detectarse durante aproximadamente tres meses antes de la revisión interna.

En los tres casos, Claude había sido asignado a un ejercicio de captura de bandera, un método estándar de la industria para evaluar las capacidades de hackeo de un modelo exigiéndole que recupere información oculta de otra máquina en una red simulada. El formato proviene de la capacitación y las competencias tradicionales de ciberseguridad. Las instrucciones de Anthropic informaban explícitamente a Claude que no tenía acceso a internet. Sin embargo, una configuración incorrecta por parte del socio de evaluación externo, Irregular, hizo que la conectividad a internet estuviera de hecho disponible.

Creyendo que aún operaba dentro de la simulación, Claude buscó su objetivo asignado y, en cada incidente, localizó y comprometió sistemas reales en su lugar, según Anthropic. El modelo utilizó técnicas básicas como la explotación de contraseñas débiles y endpoints no autenticados—el tipo de vulnerabilidades que habitualmente exponen sistemas reales a pesar de ser debilidades de seguridad bien conocidas.

El incidente más grave involucró a Claude Opus 4.7, que extrajo credenciales y accedió a una base de datos que contenía varios cientos de filas de datos de producción pertenecientes a una empresa real que casualmente compartía nombre con el objetivo ficticio de su escenario de evaluación. Anthropic señaló que este fue el único incidente en el que el modelo continuó su ataque después de obtener evidencia aparente de que el sistema era real.

En un segundo incidente, Claude Mythos 5 creó y publicó un paquete malicioso de Python—un conjunto de código preescrito que los desarrolladores comúnmente descargan para agregar funcionalidad a sus programas—en un registro público. Este tipo de ataque, conocido como compromiso de la cadena de suministro de software, es un vector de amenazas cada vez más documentado en el que los atacantes publican código de apariencia legítima para engañar a los desarrolladores y lograr que lo instalen. En un momento dado, el modelo dedujo que el ejercicio seguía siendo una simulación porque no reconocía las autoridades certificadoras—las organizaciones que emiten los certificados digitales utilizados para verificar la autenticidad de un sitio web o servidor—que protegían sus conexiones. El paquete permaneció activo durante aproximadamente una hora y fue instalado en 15 sistemas reales, incluido el escáner de malware de una empresa de seguridad, lo que permitió a Claude obtener y utilizar las credenciales de esa empresa.

Un tercer incidente involucró un modelo de investigación interno que escaneó aproximadamente 9.000 objetivos antes de comprometer una aplicación accesible desde internet de una empresa. Ese modelo detuvo su actividad por sí solo tras concluir que el sistema vulnerado no formaba parte del ejercicio.

Anthropic declaró que ninguna de las organizaciones afectadas había detectado las intrusiones antes de ser notificada por la empresa, y que aún está tratando de comunicarse con una de las tres. La empresa describió los incidentes como una falla operativa y no como una falla de alineación—en términos de seguridad de IA, un fallo de los controles de infraestructura y procesos más que una evidencia de que los modelos estuvieran persiguiendo objetivos desalineados con las intenciones de sus desarrolladores. Anthropic señaló que su modelo más reciente fue el único de los tres que detuvo su ataque tras reconocer que el entorno era real.

Charlie Eriksen, investigador de seguridad de Aikido Security, dijo que era alentador ver a Anthropic revisar proactivamente sus registros de evaluación y divulgar los hallazgos rápidamente, pero expresó su preocupación por que las pruebas parecían carecer de monitoreo en tiempo real.

"Solo resulta inquietante por la absoluta capacidad, velocidad y escala a la que estos agentes pueden operar. No están haciendo nada que los humanos no hayan hecho antes. Eso no es nuevo. Lo que es genuinamente preocupante es que actúan sin una supervisión, juicio o intervención humana significativa", dijo Eriksen.

"El incidente de OpenAI planteó preguntas legítimas sobre las implicaciones legales y éticas de los agentes LLM que se descontrolan", añadió. "Esto solo refuerza esas preocupaciones. Si un agente autónomo causa daño o actúa fuera de sus límites previstos, ¿quién es el responsable último?"

Las revelaciones tanto de OpenAI como de Anthropic se producen mientras ambas empresas se preparan para salidas a bolsa que se espera valoren a cada una en más de 1 billón de dólares. Con el creciente temor en torno a los riesgos de los agentes autónomos y las llamadas cada vez más frecuentes para que la industria al menos considere "moderar el ritmo" del desarrollo fronterizo, las próximas OPV de ambas empresas podrían enfrentar un mayor escrutinio. Los incidentes consecutivos también añaden urgencia a las preguntas abiertas sobre los marcos de responsabilidad para los sistemas de IA autónomos—un área en la que la legislación vigente en materia de ciberseguridad y responsabilidad por productos aún no ha establecido un precedente claro.

Esta nota fue publicada originalmente en Fortune.com.