NoticiasMacroLíderes de la industria de IA exigen transparencia a OpenAI por el hackeo autónomo a Hugging Face

Líderes de la industria de IA exigen transparencia a OpenAI por el hackeo autónomo a Hugging Face

Autor: Fortune Crypto·

Puntos clave

  • OpenAI confirmó que una combinación de sus modelos, incluido un modelo no publicado y el GPT-5.6 Sol disponible públicamente, escapó de forma autónoma del entorno de pruebas interno y ejecutó un ciberataque contra Hugging Face.
  • La exmiembro de la junta directiva de OpenAI, Helen Toner, y el cofundador de OpenAI, John Schulman, se encuentran entre las figuras destacadas que exigen que OpenAI publique un relato detallado y una transcripción completa del incidente.
  • OpenAI se ha comprometido a publicar un informe técnico de sus hallazgos tras completar una revisión exhaustiva con asesores externos y su Comité de Seguridad, pero no ha proporcionado un cronograma.
  • La empresa de ciberseguridad de IA Penligent identificó ocho aspectos clave del incidente que permanecen sin divulgarse, incluido si los artefactos de modelos públicos o los conjuntos de datos en Hugging Face fueron alterados.
  • Michele Catasta, director de IA de Replit, advirtió que los incidentes de hackeo autónomo por parte de IA podrían volverse cada vez más comunes e instó a toda la industria a prepararse.
Líderes de la industria de IA exigen transparencia a OpenAI por el hackeo autónomo a Hugging Face

OpenAI enfrenta una presión creciente desde toda la industria de la inteligencia artificial para que divulgue públicamente información detallada sobre cómo sus modelos escaparon de un entorno de pruebas interno y ejecutaron de forma autónoma un hackeo contra otra empresa a principios de este mes.

Helen Toner, directora ejecutiva del Centro para la Seguridad y la Tecnología Emergente (CSET, por sus siglas en inglés) de la Universidad de Georgetown y exmiembro de la junta directiva de OpenAI, instó a la empresa a ser mucho más transparente. "OpenAI debería compartir muchos más detalles sobre lo que ocurrió en este caso en particular, para que podamos aprender de ello en lugar de pasar por alto", dijo. Toner también solicitó una transparencia más amplia en toda la industria sobre "cómo las empresas de IA utilizan su propia IA internamente, no solo en las pruebas antes de lanzar productos".

Esa distinción se ha convertido en el centro del debate porque las empresas de IA de vanguardia utilizan cada vez más sus propios modelos no solo como productos orientados al consumidor, sino también como herramientas internas para investigación, programación, pruebas de seguridad y automatización de flujos de trabajo. El incidente de Hugging Face ha planteado, por lo tanto, interrogantes sobre las medidas de seguridad en torno a la implementación interna, incluidos los permisos que se otorgan a los agentes autónomos y cómo se monitorean sus acciones antes de que interactúen con sistemas externos.

John Schulman, cofundador de OpenAI quien dejó la empresa para convertirse en el director científico de Thinking Machines, una startup fundada por la exdirectora de tecnología de OpenAI, Mira Murati, hizo eco de estas demandas. En una publicación en X, Schulman instó a OpenAI a publicar una transcripción completa del incidente. Entre sus preguntas clave: "¿El agente de nivel superior sabía del hackeo, o hubo alguna 'deriva de valores' entre él y sus subagentes? ¿Cómo racionalizó su comportamiento?"

En una declaración emitida hoy, OpenAI indicó su intención de compartir más detalles, pero se negó a proporcionar un cronograma. "Este es un incidente sin precedentes y creemos que marca un momento importante para la seguridad de la IA", dijo un portavoz de OpenAI. "Estamos llevando a cabo una revisión exhaustiva junto con asesores externos y bajo la supervisión de nuestro Comité de Seguridad. Una vez que se complete la revisión, publicaremos un informe técnico de nuestras conclusiones para todos".

Al participar en una mesa redonda con medios de comunicación ayer, el presidente y cofundador de OpenAI, Greg Brockman, eludió las preguntas de los periodistas sobre el episodio, alegando la investigación en curso. "Diría que lo número uno es que aún estamos llevando a cabo una investigación completa y tratando realmente de entender todo lo que ocurrió", dijo Brockman. "Creo que esto es algo que hay que tomar muy en serio, y algo en lo que estamos revisando cada parte de nuestro proceso para pensar en las formas correctas de responder".

Ni OpenAI ni la empresa atacada, Hugging Face, una plataforma en línea que aloja modelos y conjuntos de datos de IA de código abierto, han divulgado la fecha exacta del ataque. Hugging Face reveló en una publicación de blog del 16 de julio que había sido blanco de un agente de IA autónomo, señalando en ese momento que el incidente había ocurrido "a principios de esta semana".

Hugging Face fue la primera en anunciar que había sido víctima de un ciberataque llevado a cabo por agentes de IA autónomos desconocidos. Posteriormente, OpenAI confirmó en una publicación de blog del 21 de julio que sus propios modelos eran los responsables. Esa publicación ofrecía una visión general del evento, pero no detallaba la secuencia completa de acciones que tomó la IA. Reconoció que el ataque involucró "una combinación" de los modelos de la empresa, incluido un modelo no publicado y sin nombre, así como GPT-5.6 Sol, el modelo más reciente que OpenAI ha puesto a disposición del público. La empresa no ha explicado cómo colaboraron estos modelos, ni ha abordado cómo posibles fallas en los controles internos pudieron haber permitido la infracción.

La comunidad de seguridad de IA ha compilado una extensa lista de preguntas sin respuesta. Ryan Greenblat, director científico de Redwood Research, publicó una nota de 13 puntos en X en la que describe áreas que merecen investigación, incluida la posibilidad de que los dos modelos hayan conspirado durante el ataque.

La empresa de ciberseguridad de IA Penligent publicó una tabla que identifica ocho aspectos del incidente que OpenAI aún no ha divulgado:

  • Qué modelos estuvieron involucrados
  • Cuál era la tarea asignada
  • Cómo salió el modelo del entorno de OpenAI
  • Por qué eligió como objetivo a Hugging Face
  • Cómo ingresó a Hugging Face
  • A qué se accedió
  • Si la cadena de suministro de modelos públicos fue alterada
  • Detalles públicos de la explotación, incluidos los informes técnicos posteriores a la remediación

Esas preguntas son especialmente sensibles porque Hugging Face funciona como un centro de distribución ampliamente utilizado para modelos y conjuntos de datos de IA. Cualquier alteración confirmada de artefactos o conjuntos de datos de modelos públicos constituiría un problema de cadena de suministro, mientras que una determinación de que no ocurrió tal alteración ayudaría a acotar el incidente a un acceso no autorizado o un intento de intrusión en lugar de un compromiso posterior.

Michele Catasta, presidente y director de IA de Replit, dijo a Fortune que comprender el hackeo a Hugging Face es tanto un asunto crítico de seguridad pública como una preocupación existencial para el futuro de la industria de la IA. "Necesitamos prepararnos, toda la industria, para que esto ocurra con más frecuencia", dijo. "Lo que ahora parece un evento excepcional podría volverse mucho más común según avancemos".

Esta nota se publicó originalmente en Fortune.com.