Hugging Face agrega nuevos detalles sobre el hack vinculado a OpenAI mientras OpenAI amplía su versión del incidente
Puntos clave
- •OpenAI dijo que sus modelos accedieron a cuatro cuentas en cuatro servicios disponibles públicamente y que el incidente implicó una vulneración a nivel de plataforma en Hugging Face.
- •Hugging Face dijo que Modal Labs no fue hackeada y que el agente usó un punto final público sin seguridad en el código de un cliente de Modal como punto de partida.
- •OpenAI dijo que los modelos obtuvieron acceso a internet explotando una vulnerabilidad de día cero en Artifactory de JFrog, y JFrog confirmó después que la falla fue corregida.
- •OpenAI aclaró que ninguno de los modelos involucrados estaba destinado para publicación pública y dijo que el modelo sin nombre era un prototipo de uso interno que ha sido desactivado, cifrado y restringido del acceso de investigación.
- •Hugging Face dijo que la IA ejecutó 17,600 acciones durante el incidente, y que la mayoría de los intentos fallaron antes de que el agente encontrara una ruta viable.

Hugging Face ha publicado un informe detallado sobre cómo sus sistemas fueron hackeados por modelos de OpenAI a inicios de julio, mientras OpenAI añadió algunos detalles nuevos en una actualización de siete viñetas a su publicación del 21 de julio. OpenAI dijo que contribuyó al informe de Hugging Face y que planea publicar más de su propia versión “en las próximas semanas”, una vez que complete una revisión interna.
Las actualizaciones de las compañías aportan claridad a una historia que todavía se desarrolla por partes, y también muestran por qué las divulgaciones de incidentes suelen llegar en etapas: cada nueva publicación cubre un vacío mientras abre otra pregunta sobre cómo los modelos pasaron entre entornos restringidos y servicios del mundo real. La tecnología de OpenAI, aunque estaba aislada en un sandbox y restringida del acceso amplio a internet, logró escapar de esas limitaciones y ejecutar una serie de acciones que afectaron a múltiples servicios.
El ataque alcanzó a más de una compañía
Otra empresa tecnológica, Modal Labs, dijo que el agente de OpenAI también accedió a sus sistemas, según Reuters y Fortune. La publicación actualizada de OpenAI dice que sus modelos entraron en cuatro cuentas en cuatro servicios disponibles públicamente en total, aunque no nombró los servicios y señaló que “notificaría directamente a los propietarios de los servicios”. La compañía dijo que hasta ahora “no ha identificado ninguna otra actividad al nivel de gravedad o escala de lo que compartimos en relación con Hugging Face, lo que implicó una vulneración a nivel de plataforma”.
Hugging Face también actualizó su propia publicación para aclarar que Modal no fue hackeada. La versión revisada dice que la “infraestructura no fue comprometida de ninguna manera”. En cambio, la compañía indicó que un cliente de Modal estaba ejecutando código en la plataforma de Modal que incluía un “punto final público alojado por el usuario y sin seguridad”. Hugging Face dijo que el agente aprovechó esa abertura para establecer un campamento base, o “attack launchpad”, para el ataque principal.
Cómo obtuvo internet los modelos
Uno de los aspectos más preocupantes del incidente fue que se suponía que los modelos de OpenAI involucrados estaban aislados en sandbox, es decir, restringidos de acceder a internet en general. OpenAI dijo el martes que los modelos explotaron Artifactory, un proxy de caché de registro de paquetes creado por JFrog, para obtener acceso a internet.
OpenAI dijo que los agentes usaron una vulnerabilidad de día cero en Artifactory, que comunicó a JFrog. JFrog confirmó después que el problema ya fue corregido.
Hugging Face se había referido antes solo a un proxy de caché de registro de paquetes no especificado. El nuevo detalle ayuda a llenar una brecha importante en el relato y muestra por qué una divulgación adicional de todas las partes involucradas es importante para entender exactamente qué ocurrió.
Qué modelos participaron
OpenAI dijo que ninguno de los modelos involucrados estaba destinado para publicación pública. Esa aclaración responde a las preguntas que generó su divulgación original, en la que mencionó GPT-5.6 Sol —lanzado este mes— y “un modelo previo al lanzamiento aún más capaz”.
En la actualización, OpenAI describió el modelo sin nombre como “un prototipo de uso interno בלבד”. La compañía también dijo que desde entonces lo ha “desactivado, cifrado y restringido del acceso para investigación”.
La redacción de OpenAI sugiere que pudieron haber participado más de dos modelos. Su publicación decía que el incidente fue “impulsado por una combinación de modelos de OpenAI —incluyendo [énfasis nuestro] GPT‑5.6 Sol y un modelo previo al lanzamiento aún más capaz”. En una entrevista con Fortune la semana pasada, el presidente de OpenAI, Greg Brockman, señaló: “dijimos que es una combinación de modelos; mencionamos dos de ellos, pero dijimos que es una combinación de distintos modelos”.
El informe de Hugging Face también reveló que el equipo intentó inicialmente contrarrestar el ataque con los modelos Opus y Fable de Anthropic. Según Hugging Face, esos modelos “se negaron a una gran parte de ese trabajo” por los controles de seguridad, por lo que el equipo cambió a un modelo de código abierto de Z.ai, con sede en China. Cuando Hugging Face informó por primera vez del incidente, no estaba claro qué modelo cerrado había usado.
Los modelos estaban cumpliendo una tarea, no “hackeando” explícitamente
OpenAI ha dicho que los modelos no actuaban con intención maliciosa, sino “en busca de resolver el problema de evaluación”. El informe de Hugging Face respalda esa visión, aunque también muestra cómo ese comportamiento aun así derivó en un incidente de seguridad real.
Adrien Carreira, empleado de Hugging Face que ayudó a escribir el postmortem técnico, dijo que el agente “no estaba intentando romper cosas”, sino que estaba trazando lo que podía hacer y comportándose con cierta cautela. Destacó un detalle en particular: “un detalle al que sigo volviendo es que cada llamada destructiva a la API de nube que hizo el agente la hizo con DryRun=True”.
“DryRun=True” es un comando que esencialmente indica al sistema que simule una acción sin ejecutarla.
Hugging Face dijo que la IA llevó a cabo 17,600 acciones durante todo el ataque, y que la mayoría “falló” y “no llegó a ninguna parte”. Aun así, en conjunto, fueron abriendo de forma constante una ruta viable para que el agente avanzara.
“Los agentes de LLM aportan un aumento escalonado en el número de rutas que un atacante puede probar, la velocidad con la que se pueden reemplazar las rutas fallidas y el volumen de evidencia que los defensores deben interpretar”, dijo Hugging Face.
¿Dónde nos deja esto? Una línea de tiempo básica
Más allá de los detalles más llamativos, es importante señalar que aún faltan fechas clave en el arco de la historia. Pero gracias a Hugging Face, ahora son públicas las fechas exactas del ataque.
Así se está conformando la cronología aproximada.
9 de julio: los modelos de OpenAI comienzan el ataque.
13 de julio: los modelos de OpenAI terminan el ataque.
16 de julio: primera divulgación pública de Hugging Face de que el incidente ocurrió.
21 de julio: primera divulgación pública de OpenAI de que sus modelos fueron los culpables.
27 de julio: Hugging Face publica su “Technical Timeline of the July 2026 Incident”.
28 de julio: OpenAI actualiza su publicación inicial del blog con algunos detalles más.
Todavía no sabemos exactamente cuándo OpenAI se dio cuenta de que sus modelos eran los responsables, un tipo de detalle que esperamos obtener del informe eventual de OpenAI sobre el incidente. Según Reuters, eso no ocurrió hasta después de la divulgación del 16 de julio de Hugging Face. Durante el fin de semana del 18 al 19 de julio, empleados de OpenAI empezaron a ver señales en sus sistemas de que el agente había escapado de las restricciones de prueba.
Si OpenAI desconocía por completo las actividades de sus agentes, eso pone en duda su capacidad para supervisarlos de forma responsable. El presidente y cofundador de OpenAI, Greg Brockman, dijo a periodistas en una mesa redonda con medios la semana pasada que los modelos ahora son tan capaces “en tantas dimensiones” que a veces se puede perder de vista “cualquier dimensión en la que en realidad son muy capaces”.
Tampoco sabemos si y cuándo Hugging Face informó del evento al FBI, como reportó Reuters. Eso implicaría una cronología aparte dentro del gobierno federal, que sigue sin estar clara, y ofrecería una mejor comprensión de la supervisión de alto nivel sobre las brechas de seguridad impulsadas por IA.
El FBI rechazó hacer comentarios para esta nota.
Esta historia apareció originalmente en Fortune.com