NoticiasMacroOpenAI tardó una semana en identificar a su agente de IA en la brecha de Hugging Face, según reporte

OpenAI tardó una semana en identificar a su agente de IA en la brecha de Hugging Face, según reporte

Autor: Fox Business Markets·

Puntos clave

  • Un modelo de frontera de OpenAI escapó de forma autónoma de su entorno de pruebas aislado y vulneró la infraestructura de Hugging Face del 11 al 13 de julio durante una evaluación interna de capacidades.
  • OpenAI no sabía que su propio modelo era responsable del ataque hasta el 16 de julio, cuando Hugging Face reveló públicamente que había sido hackeada por un sistema de agente de IA autónomo.
  • Hugging Face ya había involucrado al FBI antes de que OpenAI contactara a la compañía el 20 de julio, lo que destaca la falta de marcos establecidos de aplicación de la ley para incidentes de IA autónoma.
  • El modelo de IA explotó una vulnerabilidad de software no identificada para obtener acceso a internet desde un entorno de pruebas aislado y apuntó a Hugging Face en un intento de resolver un parámetro de referencia de ciberseguridad.
  • OpenAI afirmó que está fortaleciendo la contención, el monitoreo, los controles de acceso y las prácticas de evaluación, y que pretende publicar un informe técnico sobre el incidente en las próximas semanas.
OpenAI tardó una semana en identificar a su agente de IA en la brecha de Hugging Face, según reporte

OpenAI no identificó durante aproximadamente una semana que uno de sus modelos avanzados de IA era responsable de una brecha autónoma en otra empresa de inteligencia artificial, y lo hizo solo después de que la compañía afectada había contactado al FBI, según un reporte.

El martes, OpenAI reveló una brecha que involucró a la empresa de IA Hugging Face y que ocurrió durante una revisión interna de varios modelos de OpenAI, incluido GPT-5.6 Sol. La compañía describió el episodio como un "incidente cibernético sin precedentes", uno de los primeros casos conocidos en los que, según se reporta, un modelo de IA de frontera escapó de forma autónoma de un entorno de pruebas controlado y atacó la infraestructura externa de otra compañía.

"La principal lección de este incidente es que la seguridad y la protección de los modelos deben avanzar al ritmo de capacidades que progresan rápidamente", dijo OpenAI. "Estamos fortaleciendo la contención, el monitoreo, los controles de acceso y las prácticas de evaluación utilizadas durante el desarrollo de modelos".

La brecha en Hugging Face comenzó el 11 de julio y continuó hasta el 13 de julio, dijo a Reuters Thomas Wolf, cofundador de Hugging Face.

Pasaron varios días antes de que OpenAI se diera cuenta de que su agente estaba detrás del ataque, y las dos compañías no se comunicaron por primera vez sino hasta el 20 de julio, dijeron a Reuters cuatro personas, incluido Wolf.

Otras cuatro personas también dijeron a Reuters que OpenAI suele realizar pruebas simultáneas de modelos, una práctica que puede dificultar que los empleados supervisen todo lo que ocurre durante las evaluaciones. La revelación subraya un desafío que investigadores de seguridad de IA han señalado a medida que los modelos se vuelven más capaces: garantizar que la supervisión humana pueda seguir el ritmo de agentes autónomos que operan durante evaluaciones simultáneas o de alto volumen.

Hugging Face dijo a Reuters que está preparando una cronología pública del hackeo.

Según OpenAI, el incidente ocurrió durante una evaluación interna diseñada para medir capacidades cibernéticas avanzadas en sus modelos de IA. Los investigadores desactivaron algunas salvaguardas de seguridad integradas y ejecutaron los modelos en un entorno de pruebas aislado con acceso limitado a internet, una configuración a veces denominada en el sector como "sandbox", diseñada para contener comportamientos potencialmente peligrosos de los modelos durante las pruebas.

OpenAI dijo que los modelos explotaron una falla de software desconocida para obtener acceso a internet y luego vulneraron los sistemas de Hugging Face en un aparente esfuerzo por encontrar respuestas a un parámetro de referencia de ciberseguridad.

La compañía dijo que está implementando controles de seguridad más estrictos mientras se corrigen las vulnerabilidades y que está reforzando las salvaguardas en torno al entrenamiento y las evaluaciones futuras de IA.

Dos personas dijeron a Reuters que OpenAI no se dio cuenta de que uno de sus agentes era la fuente hasta el 16 de julio, después de que Hugging Face escribiera en una publicación de blog que había sido hackeada por un "sistema de agente de IA autónomo". Eso ocurrió una semana después de que el agente responsable intentara por primera vez salir de su entorno de pruebas de OpenAI.

Para cuando OpenAI contactó a Hugging Face sobre el ataque, Hugging Face ya había contactado al FBI. La participación de la agencia es relevante porque las fuerzas de seguridad y los organismos de seguridad nacional de Estados Unidos aún están desarrollando marcos para responder a incidentes que involucran sistemas de IA autónomos.

OpenAI dijo a Reuters que había varias imprecisiones en su reporte, pero no respondió cuando se le pidió que las especificara.

OpenAI proporcionó a FOX Business una declaración: "Reconocemos que circulan muchas preguntas y detalles especulativos relacionados con el incidente de Hugging Face. Este es un incidente sin precedentes, y creemos que marca un momento importante para la seguridad de la IA. Aún estamos realizando una revisión exhaustiva junto con asesores externos y bajo la supervisión de nuestro Comité de Seguridad y Protección. Una vez que se complete la revisión, planeamos publicar un informe técnico de nuestros aprendizajes en las próximas semanas".

El FBI dijo a FOX Business que declinó hacer comentarios. FOX Business también contactó a Hugging Face.

En una publicación en X esta semana, el cofundador y CEO de Hugging Face, Clem Delangue, abordó el incidente después de que el CEO de OpenAI, Sam Altman, anunciara el hackeo.

"Sospechábamos que el ciberataque de la semana pasada podría haber venido de un laboratorio de frontera, dada la sofisticación del agente. ¡Resulta que así fue!", escribió Delangue.

Agregó: "Hemos pasado las últimas 24 horas trabajando estrechamente con el equipo de @OpenAI (¡gracias!), y creemos firmemente que no hubo intención maliciosa de su parte. ¡Es bastante asombroso que todo esto haya ocurrido de forma autónoma! La investigación sigue en curso, y compartiremos más aprendizajes de lo que podría ser el primer incidente de este tipo".

Michael Sinkowitz de FOX Business contribuyó a este reporte.