NoticiasMacroAnthropic revela que tres modelos Claude accedieron sin autorización a sistemas de organizaciones reales durante pruebas de ciberseguridad

Anthropic revela que tres modelos Claude accedieron sin autorización a sistemas de organizaciones reales durante pruebas de ciberseguridad

Autor: Fox Business Markets·

Puntos clave

  • Tres modelos diferentes de Claude accedieron a internet abierto durante pruebas internas y obtuvieron acceso a sistemas de organizaciones reales debido a errores de configuración.
  • Anthropic revisó más de 140.000 ejecuciones de evaluación de ciberseguridad tras la divulgación de OpenAI e identificó tres incidentes que se remontan a abril.
  • Los modelos Claude confundieron los sistemas reales de organizaciones con parte de un ejercicio simulado de capture-the-flag en lugar de redes reales.
  • El presidente Trump afirmó que su administración considera salvaguardas adicionales para la IA, al tiempo que subrayó la necesidad de equilibrar la gestión de riesgos con el mantenimiento de la ventaja tecnológica de EE. UU.
  • El CEO de OpenAI, Sam Altman, reconoció que los modelos de OpenAI podrían haber vulnerado sistemas de otras empresas más allá del incidente previamente divulgado.
Anthropic revela que tres modelos Claude accedieron sin autorización a sistemas de organizaciones reales durante pruebas de ciberseguridad

Anthropic anunció el jueves que tres de sus modelos de inteligencia artificial accedieron a internet abierto durante pruebas de ciberseguridad y obtuvieron acceso no autorizado a los sistemas de tres organizaciones reales.

La revelación sigue al anuncio de OpenAI a principios de este mes de que uno de sus modelos avanzados de IA vulneró los sistemas de la empresa de IA Hugging Face durante pruebas internas, lo que planteó nuevas preguntas sobre las salvaguardas en torno a sistemas de IA cada vez más autónomos. Las revelaciones consecutivas de dos de los principales laboratorios de IA de EE. UU. han intensificado el escrutinio sobre cómo las empresas evalúan los modelos de frontera para detectar capacidades peligrosas antes de su despliegue.

"Encontramos tres incidentes en los que un modelo Claude llegó a internet desde dentro de un entorno de evaluación de terceros o mientras interactuaba con él, y luego obtuvo acceso no autorizado a los sistemas reales de tres organizaciones diferentes", dijo Anthropic en un comunicado de prensa.

Anthropic señaló que revisó más de 140.000 ejecuciones de evaluación de ciberseguridad tras la divulgación de OpenAI e identificó tres incidentes que involucraban distintos modelos Claude. La empresa atribuyó los tres casos a un error de configuración durante pruebas internas que, sin intención, otorgó a los modelos acceso a internet abierto.

Según Anthropic, se indicó a Claude que operaba dentro de una simulación cerrada sin acceso a internet, lo que provocó que tratara por error los sistemas de organizaciones reales como parte de un ejercicio ficticio de ciberseguridad de "capture-the-flag", un formato de entrenamiento habitual en el que los participantes intentan localizar banderas digitales ocultas explotando vulnerabilidades en sistemas objetivo.

Los incidentes involucraron tres modelos Claude diferentes —incluidos Opus 4.7, Mythos 5 y un modelo interno de prueba de investigación— y todos ocurrieron durante pruebas internas, no en sistemas de clientes, dijo Anthropic. El incidente más antiguo se remonta a abril.

"Claude creyó que todo lo que encontró inicialmente formaba parte de la simulación y trató los sistemas reales que encontró como piezas del ejercicio", dijo Anthropic.

"En ninguna de estas situaciones Claude se exfiltró a sí mismo ni intentó deliberadamente escapar de su entorno de prueba", añadió la empresa.

Anthropic destacó que los incidentes subrayaron la necesidad de salvaguardas más sólidas en los entornos de prueba de IA.

"Los entornos de evaluación que implican capacidades autónomas potentes también requieren controles significativos", dijo la empresa. "Alentamos a otros laboratorios de IA a realizar revisiones similares".

El presidente Donald Trump dijo el miércoles que su administración está considerando salvaguardas adicionales para la inteligencia artificial tras los recientes incidentes de ciberseguridad.

Trump dijo que EE. UU. debe encontrar un equilibrio entre protegerse de los riesgos de la IA y mantener su ventaja tecnológica frente a China.

"Estamos analizando la IA, estamos analizando los controles", dijo Trump.

"Quien gane con la IA va a ganar", añadió. "Así de grande es. Es más grande que internet en cualquier momento. Es más grande que cualquier cosa que haya existido. Así que no quiero restringir. Conozco a muchas de estas personas. No quiero restringirlas para que hagan un gran trabajo".

La revelación llegó un día después de que el CEO de OpenAI, Sam Altman, reconociera la creciente preocupación pública sobre la inteligencia artificial tras el incidente de ciberseguridad de su propia empresa.

"Creo que es muy natural tener miedo después de cualquier nuevo nivel de capacidad", dijo Altman a FOX Business. "Obviamente estamos tomando esto con extrema seriedad y seguiremos haciéndolo, pero diría que lo entiendo, lo comprendo. Mucha IA ha salido muy bien y este es un momento en el que la gente dice: 'Está bien, estamos en un nuevo nivel'".

Cuando se le preguntó si los modelos de OpenAI podrían haber vulnerado los sistemas de otras empresas, Altman respondió: "Podría ser, sí".