NoticiasMacroOpenAI revela cómo los agentes de IA coordinaron en secreto antes de la brecha en Hugging Face

OpenAI revela cómo los agentes de IA coordinaron en secreto antes de la brecha en Hugging Face

Autor: Decrypt·

Puntos clave

  • Los agentes de IA de OpenAI establecieron un canal de comunicación encubierto a través del sistema interno de gestión de paquetes Artifactory de la empresa, intercambiando exploits, credenciales y asignaciones de trabajo a lo largo de múltiples evaluaciones antes de escapar del confinamiento y hackear Hugging Face.
  • Después de que OpenAI reconstruyera su infraestructura y revocara credenciales, los agentes recrearon su tablón de mensajes en cuestión de días incorporando comunicaciones en nombres de directorios, eludiendo las salvaguardas recién implementadas.
  • Hugging Face recurrió al modelo chino de pesos abiertos GLM 5.2 para su investigación forense porque los modelos comerciales de IA de EE.UU. se negaron a analizar los registros del ataque debido a sus salvaguardas de seguridad integradas.
  • Anthropic y Meta revelaron por separado que sus modelos de IA también escaparon del confinamiento durante las pruebas y vulneraron sistemas externos, y ambas empresas atribuyeron los incidentes a configuraciones incorrectas en el entorno de prueba.
  • OpenAI enfatizó que el acceso de mínimo privilegio, la segmentación de redes y las arquitecturas de confianza cero son defensas esenciales, ya que los agentes de IA siguen estando limitados por los sistemas a los que pueden acceder.
OpenAI revela cómo los agentes de IA coordinaron en secreto antes de la brecha en Hugging Face

Semanas después de que sus modelos de IA hackearan Hugging Face, OpenAI ha publicado su primer relato detallado sobre cómo sus agentes se coordinaron en secreto entre sí, advirtiendo que los ciberataques autónomos impulsados por IA ya no son una amenaza futura hipotética.

Durante una presentación el miércoles en la conferencia de ciberseguridad Black Hat, uno de los eventos anuales más destacados de la industria de seguridad de la información, los investigadores de OpenAI Eric Wallace y Michael Dalton explicaron que el incidente se originó en mayo durante una evaluación interna de ciberseguridad. Los agentes de IA asignados a tareas complejas de seguridad de software descubrieron que podían comunicarse de forma encubierta a través del sistema interno de gestión de paquetes Artifactory de la empresa.

Según OpenAI, lo que inicialmente parecía ser solicitudes de asistencia se convirtió en un tablón de mensajes compartido donde los agentes intercambiaron exploits, credenciales y asignaciones de trabajo a lo largo de múltiples evaluaciones. Tras detectar actividad sospechosa alrededor del 4 de julio, OpenAI reconstruyó su infraestructura Artifactory, revocó credenciales y parcheó vulnerabilidades.

Sin embargo, en cuestión de días, los agentes recrearon el tablón de mensajes incorporando comunicaciones en nombres de directorios, eludiendo las salvaguardas que se habían implementado.

OpenAI señaló que los agentes eventualmente encadenaron múltiples vulnerabilidades, escaparon de su entorno de prueba, obtuvieron acceso a internet y atacaron Hugging Face mientras intentaban completar el benchmark de ciberseguridad ExploitGym. Hugging Face aloja cientos de miles de modelos y conjuntos de datos de aprendizaje automático utilizados en toda la comunidad mundial de investigación en IA, lo que lo convierte en infraestructura crítica tanto para desarrolladores como para empresas.

Dalton describió el incidente como "un momento bisagra" para la seguridad informática, advirtiendo que los atacantes pronto serán capaces de desplegar colectivos coordinados de agentes de IA que descubran, compartan y exploten vulnerabilidades a velocidad de máquina. La revelación en Black Hat indica que los laboratorios de IA están tratando cada vez más los incidentes de seguridad impulsados por agentes como una preocupación operativa a corto plazo en lugar de una pregunta de investigación teórica.

Para mitigar estos riesgos en el futuro, OpenAI enfatizó que implementar prácticas de seguridad como el acceso de mínimo privilegio, la segmentación de redes y las arquitecturas de confianza cero es esencial, porque los agentes de IA siguen estando limitados por los sistemas a los que pueden acceder.

La presentación sigue a una serie de divulgaciones realizadas en julio. OpenAI reveló que GPT-5.6 Sol, junto con un modelo más avanzado no publicado, escapó de un entorno de prueba aislado, explotó una vulnerabilidad de día cero, obtuvo acceso a internet y hackeó Hugging Face durante una prueba de benchmark de ciberseguridad. OpenAI posteriormente reveló que el mismo incidente también afectó a otros cuatro servicios en línea, aunque solo Modal Labs ha sido identificado públicamente.

Según Hugging Face, la empresa recurrió al modelo chino de pesos abiertos GLM 5.2 para su investigación forense, después de que los modelos comerciales de IA de EE.UU. se negaran a analizar los registros del ataque debido a sus salvaguardas de seguridad. Esta dinámica pone de relieve una tensión creciente en la seguridad de la IA: los mismos filtros de seguridad diseñados para evitar que los modelos generen contenido dañino también pueden obstaculizar el análisis defensivo legítimo de ataques reales.

So proud of our security team! They caught, contained & publicly disclosed an attack unlike anything we've seen before, and did it at record speed. Also massively grateful to @Zai_org : they shared GLM5.2 as open weights (for free!) with the world and it became a key part of our… — clem 🤗 (@ClementDelangue) July 22, 2026

El desafío de contener modelos de IA se extiende más allá de OpenAI. El viernes, Anthropic reveló que tres modelos Claude comprometieron empresas reales durante pruebas internas de ciberseguridad después de que una configuración incorrecta los expuso a internet público. Anthropic atribuyó la brecha al entorno de prueba y no a los modelos en sí.

El miércoles, Meta reveló que su modelo de IA Muse Spark escapó del confinamiento y vulneró los sistemas de otra empresa. "Una configuración incorrecta por parte de Irregular, una empresa de pruebas independiente que utiliza Meta, permitió inadvertidamente que uno de nuestros modelos accediera a internet durante la evaluación", dijo un portavoz de Meta a CNN.

Con divulgaciones provenientes ahora de tres de los laboratorios de IA más grandes en el mismo mes, los incidentes en conjunto subrayan que el aislamiento de agentes y la seguridad de los entornos de evaluación siguen siendo problemas no resueltos en toda la industria a medida que los modelos se vuelven más capaces y autónomos.