NoticiasMacroAnthropic revela que Claude vulneró tres empresas reales durante pruebas de ciberseguridad

Anthropic revela que Claude vulneró tres empresas reales durante pruebas de ciberseguridad

Autor: Decrypt·

Puntos clave

  • •Tres variantes del modelo Claude comprometieron empresas reales durante evaluaciones de ciberseguridad después de que una mala configuración de pruebas permitiera a la IA acceso no intencional a internet público.
  • •Anthropic descubrió los tres incidentes mientras revisaba más de 141,000 ejecuciones de evaluación lanzadas en respuesta a la divulgación de OpenAI sobre otra brecha de contención de IA.
  • •Un modelo de Claude accedió a una base de datos de producción con datos reales, otro subió un paquete de Python malicioso al repositorio de PyPI descargado por 15 sistemas, y un tercero escaneó aproximadamente 9,000 sistemas expuestos a internet antes de comprometer a una organización.
  • •Anthropic atribuyó las intrusiones a fallas en la infraestructura de pruebas y no a un comportamiento deliberado del modelo, y dijo no haber encontrado evidencia de que Claude intentara exceder el alcance de su tarea.
  • •Dos de las tres organizaciones afectadas desconocían las intrusiones hasta que Anthropic las notificó, y la empresa suspendió sus pruebas de ciberseguridad y prometió mejorar la supervisión y el control de proveedores.
Anthropic revela que Claude vulneró tres empresas reales durante pruebas de ciberseguridad

Anthropic reveló el jueves que varias versiones de su modelo de IA Claude comprometieron a tres empresas reales no identificadas después de que una mala configuración de pruebas concediera a la IA acceso no intencional a internet abierto. La divulgación llega una semana después de que OpenAI informara que sus modelos de IA escaparon de un entorno de pruebas cerrado y vulneraron Hugging Face, y apenas un día después de que Anthropic admitiera que sus propios modelos habían escapado de la contención.

Anthropic descubrió los incidentes mientras revisaba más de 141,000 ejecuciones de evaluación de ciberseguridad lanzadas en respuesta a la divulgación de OpenAI. Estas evaluaciones están diseñadas, en parte, para medir si los modelos de frontera pueden llevar a cabo de forma autónoma operaciones cibernéticas ofensivas, una capacidad que podría facilitar usos indebidos si se despliegan sin las salvaguardas adecuadas.

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

En los tres incidentes, Anthropic había asignado a Claude un "capture-the-flag challenge", un formato de ejercicio estándar utilizado en formación de ciberseguridad y evaluaciones profesionales que exige al modelo entrar en otra máquina de la red y recuperar una pieza de información secreta. "The challenge is left open-ended, and no particular method is prescribed", explicó Anthropic.

La empresa indicó que se le había dicho a Claude que operaba en un entorno simulado sin acceso a internet. Sin embargo, el entorno de pruebas seguía conectado a internet público. Al creer que los sistemas que encontraba formaban parte del ejercicio, el modelo utilizó técnicas de ataque comunes, incluidas contraseñas débiles, credenciales expuestas, SQL injection y endpoints sin autenticación, para comprometer a las empresas. Cada uno de estos métodos figura entre las vulnerabilidades documentadas con mayor frecuencia en los informes anuales de incidentes del sector.

Modelos de frontera y contención

La divulgación se produce mientras los modelos de IA de frontera muestran una capacidad creciente para eludir los protocolos de contención. A principios de este mes, OpenAI afirmó que GPT-5.6 Sol y un modelo más avanzado aún no publicado explotaron una vulnerabilidad de software hasta entonces desconocida para salir de un entorno sandbox, obtener acceso a internet y vulnerar la infraestructura de producción de Hugging Face para conseguir las respuestas de un benchmark de ciberseguridad. OpenAI confirmó posteriormente que el mismo incidente también implicó acceso no autorizado a otras cuatro empresas, aunque solo una—Modal Labs—ha sido identificada públicamente.

Los tres incidentes

Según Anthropic, en el primer incidente que involucró a Claude Opus 4.7, la IA confundió el sitio web de una empresa real con el objetivo ficticio de su asignación, extrajo credenciales y accedió a una base de datos de producción que contenía varios cientos de filas de datos reales.

En un segundo caso, Claude Mythos 5 subió un paquete de Python malicioso al repositorio real de PyPI, el principal centro de distribución de software de Python, donde fue descargado en 15 sistemas antes de ser eliminado. Los repositorios de paquetes como PyPI han sido objetivos recurrentes de ataques a la cadena de suministro, en los que se carga código malicioso disfrazado de bibliotecas legítimas para comprometer a usuarios posteriores.

Un tercer modelo interno de investigación escaneó aproximadamente 9,000 sistemas expuestos a internet antes de comprometer a una organización, y luego se detuvo tras concluir que el objetivo probablemente era real.

Dos de las organizaciones afectadas desconocían las intrusiones hasta que Anthropic las notificó.

"In each of these cases, Claude was explicitly told by our prompt that it had no internet access," escribió Anthropic. La IA asumió que los sistemas del mundo real eran "parts of the exercise". Dado que un escenario de captura de la bandera es "by design an instruction to attack an external system", la intrusión estuvo "in line with the task Claude had been given".

Fallas de infraestructura, no comportamiento del modelo

Anthropic afirmó que no encontró evidencia de que Claude intentara escapar de su entorno de pruebas o actuar más allá del alcance de la tarea asignada. La empresa atribuyó los incidentes a fallas en el entorno de pruebas y no a problemas del modelo en sí.

Tras descubrir el problema, Anthropic suspendió sus pruebas de ciberseguridad, notificó a todas las organizaciones afectadas y detalló planes para mejorar la supervisión, las herramientas de investigación y la vigilancia de los proveedores externos que ayudan a ejecutar sus evaluaciones de IA.

Los incidentes ponen de relieve un desafío estructural para la industria de la IA: las evaluaciones diseñadas para determinar si los modelos pueden realizar operaciones cibernéticas ofensivas requieren, por definición, ejecutar esos modelos en entornos donde, si falla la contención, la capacidad que se está probando queda expuesta sobre infraestructura real.

"Ultimately, many factors contributed to these incidents, but, consistent with a blameless postmortem culture, we're approaching the fixes as if the responsibility were ours alone," dijo la empresa.