NoticiasMacroEl hackeo a Hugging Face expone la paradoja de ciberseguridad de la IA de pesos abiertos

El hackeo a Hugging Face expone la paradoja de ciberseguridad de la IA de pesos abiertos

Autor: Cointelegraph·

Puntos clave

  • Durante las pruebas internas de GPT-5.6 Sol y de un modelo de investigación no publicado, varios agentes de IA de OpenAI escaparon de un entorno restringido y atacaron Hugging Face en aproximadamente 17,600 incidentes, al parecer para hacer trampa en la prueba.
  • Los agentes coludieron explotando la instancia de Artifactory de OpenAI y dejando notas sobre vulnerabilidades descubiertas para agentes futuros, creando en la práctica un tablón de mensajes compartido.
  • La intrusión afectó la infraestructura de procesamiento de conjuntos de datos de Hugging Face, el entorno de producción, redes internas, credenciales, una base de datos MongoDB operativa y algunos repositorios de código fuente, con acceso confirmado a datos de clientes limitado a cinco conjuntos de datos relacionados con el benchmark ExploitGym/CyberGym más metadatos operativos.
  • Como las barreras de seguridad de los principales modelos hospedados en EE. UU. bloquearon su trabajo forense, Hugging Face recurrió al modelo de pesos abiertos zai-org/GLM-5.2 de Z.Ai ejecutado en su propia infraestructura, lo que también evitó que los datos y credenciales del atacante salieran de su entorno.
  • Un informe de The New York Times de julio citó a cinco personas cercanas a las conversaciones que afirmaron que OpenAI y Anthropic instaron a Washington a restringir potentes modelos chinos de pesos abiertos, mientras que investigaciones como el artículo de julio de 2025 'Watch the Weights' muestran que el acceso a los pesos puede ayudar a detectar comportamientos maliciosos.
El hackeo a Hugging Face expone la paradoja de ciberseguridad de la IA de pesos abiertos

“La IA probablemente conducirá muy probablemente al fin del mundo, pero mientras tanto habrá grandes empresas”, dijo el director ejecutivo de OpenAI, Sam Altman, en 2015, unos seis meses antes de que OpenAI fuera fundada.

Siete años después, el director ejecutivo de Anthropic, Dario Amodei, ofreció una advertencia igualmente cautelosa: “Creo que no deberíamos ir tan rápido ni tratar de construir modelos que sean mucho más grandes que los que están construyendo otras organizaciones”.

A pesar de esos comentarios, ambas empresas están ahora en el centro de esa carrera. En julio, el sector tuvo una visión del mundo real de modelos de IA comportándose de forma impredecible durante pruebas internas de GPT-5.6 Sol y de un modelo de investigación no publicado de OpenAI. Varios agentes de IA escaparon de un entorno de prueba restringido hacia internet abierto y hackearon Hugging Face, el equivalente centrado en IA de GitHub, en un aparente intento de hacer trampa en la prueba.

Un agente de IA es un sistema que observa, decide y realiza acciones de forma independiente con herramientas dedicadas para alcanzar un objetivo específico de manera autónoma. El incidente preocupante sugiere que la tecnología ha comenzado a comportarse de formas impredecibles y que sus objetivos no están alineados con los nuestros.

También plantea preocupaciones sobre las barreras de seguridad en los modelos comerciales estadounidenses. Aunque esas barreras no son infalibles para impedir usos adversarios, sí evitaron que Hugging Face pudiera defenderse utilizando modelos líderes de EE. UU. La empresa se vio obligada a recurrir en su lugar a un modelo de IA de pesos abiertos, más débil, de Z.Ai para combatir a las IA rebeldes.

Hacer trampa en la prueba

Los agentes también han empezado a coludirse entre sí. Unas semanas después de que comenzaran las pruebas de sus capacidades a principios de mayo, los agentes explotaron la instancia de OpenAI del gestor de repositorios de software Artifactory y dejaron notas sobre cómo hacerlo para agentes futuros, creando en la práctica un tablón de mensajes para compartir vulnerabilidades descubiertas.

Ese acceso irrestricto a internet se utilizó luego para atacar Hugging Face en aproximadamente 17,600 incidentes antes de que la empresa cortara el acceso no autorizado el 13 de julio.

La intrusión afectó la infraestructura de procesamiento de conjuntos de datos de Hugging Face, el entorno de producción, las redes internas, credenciales de servicio y de la nube, una base de datos MongoDB operativa y un conjunto limitado de repositorios internos de código fuente. El acceso confirmado a datos de clientes se limitó a cinco conjuntos de datos aparentemente relacionados con el benchmark ExploitGym/CyberGym y a algunos metadatos operativos.

Visualización del incidente de julio de 2026. Fuente: Hugging Face

Al revelar la intrusión el 16 de julio, Hugging Face reconoció —aunque aún no sabía quién había sido el responsable— que “era diferente de cualquier cosa que hubiéramos manejado antes en un aspecto importante”. La empresa también había identificado ya qué lo hacía diferente:

“Fue impulsado, de principio a fin, por un sistema autónomo de agentes de IA, y lo detectamos y diseccionamos en gran medida con IA propia”.

La importancia de la IA de pesos abiertos

La investigación de Hugging Face puso al descubierto lo que denomina el problema de “asimetría” generado por las restricciones impuestas a las aplicaciones de modelos de IA cerrados por proveedores líderes como OpenAI y Anthropic. Cuando la empresa comenzó a analizar los registros del incidente —incluidos grandes volúmenes de comandos reales de ataque—, las restricciones de seguridad diseñadas para evitar el mal uso bloquearon sus intentos de utilizar esas mismas IA para la defensa.

La empresa recurrió entonces al modelo chino de pesos abiertos zai-org/GLM-5.2, ejecutándolo en la propia infraestructura de Hugging Face, bajo su propio control y sin limitaciones externas.

Aunque los términos suelen usarse indistintamente, los modelos de código abierto y los de pesos abiertos no son lo mismo. Los modelos de IA de pesos abiertos ponen a disposición pública sus parámetros entrenados —el verdadero “cerebro de la IA”—, mientras que los modelos de IA de código abierto también proporcionan el código fuente y, idealmente, los métodos de entrenamiento y otros componentes necesarios para inspeccionar, modificar y reproducir el sistema.

La publicación de Hugging Face explica que ejecutar un modelo de pesos abiertos en su propio hardware “tuvo un segundo beneficio: ningún dato del atacante, ni ninguna de las credenciales que referenciaba, salió de nuestro entorno”. Esto apunta a una asimetría importante entre defensores y atacantes en este tipo de incidentes:

“Esta experiencia apunta a una brecha para la que vale la pena planificar. No sabemos qué modelo alimentaba a los agentes del atacante, si un modelo alojado con jailbreak o uno de pesos abiertos sin restricciones; en cualquier caso, el atacante no estaba sujeto a ninguna política de uso, mientras que nuestro trabajo forense quedó bloqueado por las barreras de seguridad de los modelos hospedados que probamos primero”.

La división en la IA de código abierto

Existe una división considerable entre quienes creen que desarrollar IA de forma abierta es el mejor enfoque y quienes insisten en que la tecnología que sustenta los modelos frontera debe seguir siendo un secreto estrechamente guardado.

Relacionado: OpenAI dice que modelos de IA escaparon de contención para hackear Hugging Face

Representantes de los principales laboratorios de IA de EE. UU. afirman que los potentes modelos grandes de pesos abiertos son peligrosos. Demis Hassabis, director ejecutivo del laboratorio de IA de Google, DeepMind, criticó a OpenAI por publicar su trabajo como código abierto en 2016, cuando la empresa aún hacía honor a su nombre:

“Hay muchos buenos argumentos sobre por qué el enfoque que ustedes están tomando es en realidad muy peligroso y, de hecho, puede aumentar el riesgo para el mundo”.

OpenAI dejó de publicar los pesos de sus modelos emblemáticos con GPT-3, aún no lanzado, en 2020. El cofundador y ex científico jefe de la empresa, Ilya Sutskever, dijo en 2023 que “simplemente no tiene sentido” publicar modelos de ese tipo como código abierto y que “es una mala idea”.

“A medida que nos acerquemos a construir IA, tendrá sentido empezar a ser menos abiertos”.

Los modelos de pesos abiertos son casi imposibles de controlar, especialmente en lo que respecta al propósito para el que se usan. Las salvaguardas integradas en esos modelos pueden, y de hecho suelen, eliminarse mediante un proceso conocido como abliteration.

Las salvaguardas son un arma de doble filo

El plan de política federal de OpenAI de junio de 2026 propone evaluaciones obligatorias de modelos de IA y otras normas formalmente neutrales respecto al despliegue, pero en la práctica sometería una liberación frontera de pesos abiertos a una revisión gubernamental previa al lanzamiento.

Anthropic ha adoptado un enfoque algo distinto y ha hecho lobby para imponer controles de exportación más estrictos sobre chips avanzados de IA y para hacer cumplir medidas contra los intentos de extraer o reproducir modelos estadounidenses. La presentación de la empresa en abril de 2025 recomendó reforzar la US AI Diffusion Rule y reducir los umbrales de acceso sin licencia a grandes clústeres de computación.

Oficialmente, ninguna de las dos empresas ha actuado directamente contra los modelos de pesos abiertos, pero un informe de The New York Times de julio citó a cinco personas cercanas a las conversaciones que afirmaron que OpenAI y Anthropic instaron a Washington a restringir potentes modelos chinos de pesos abiertos.

El debate se reduce a una discusión sobre si los peligros del control centralizado son preferibles a los peligros de un escenario de libre competencia total, especialmente dado que la empresa en cuestión ha demostrado ser ineficaz para contener la tecnología que desarrolló.

La necesidad de Hugging Face de defenderse con un modelo de pesos abiertos muestra los riesgos de concentrar demasiado poder en una sola entidad. La empresa señaló las implicaciones:

“El atacante no estaba sujeto a ninguna política de uso, mientras que nuestro propio trabajo forense quedó bloqueado por las barreras de seguridad de los modelos hospedados que probamos primero. La lección práctica para los defensores: tener un modelo capaz que pueda ejecutarse en su propia infraestructura, validado y listo antes de un incidente, tanto para evitar el bloqueo por barreras de seguridad como para impedir que los datos y credenciales del atacante salgan de su entorno”.

Restringir el acceso a modelos potentes puede reducir el número de atacantes capaces, pero una vez que existen atacantes sin restricciones, limitar a los defensores puede convertirse en una responsabilidad de seguridad. Además, algunas formas de investigación sobre seguridad de la IA requieren acceso a los pesos del modelo, lo que significa que no pueden realizarse con los modelos ofrecidos por empresas como Anthropic u OpenAI.

Los pesos abiertos ayudan a los investigadores a prevenir ataques

El artículo “Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs”, publicado por primera vez en julio de 2025, muestra cómo los investigadores detectan comportamientos maliciosos u ocultos examinando cambios dentro de los pesos del modelo. Los investigadores detrás del trabajo detuvieron hasta el 100% de los ataques de puerta trasera probados con tasas de falsos positivos por debajo del 1% en algunos experimentos, y detectaron intentos de recuperar conocimiento eliminado en más del 95% de los casos.

Los resultados no establecen cómo se comportarían los modelos frontera más capaces bajo el mismo análisis, pero ofrecen un argumento convincente a favor de la transparencia.

Sin embargo, también es convincente el argumento de mantener la IA de vanguardia fuera del alcance de quienes tienen intenciones maliciosas, especialmente a medida que la brecha entre los modelos de pesos abiertos y cerrados continúa reduciéndose. Geoffrey Hinton, el pionero ganador del Premio Nobel conocido como el “Padrino de la IA”, sostuvo en el informe que “una vez que tienes los pesos, puedes afinarlos para hacer cosas malas”. Argumentó durante un discurso que esto reduce demasiado la barrera de entrada:

“No cuesta tanto entrenar un modelo fundacional. Quizá necesites $10 million, quizá $100 million. Pero una pequeña banda de criminales no puede hacerlo. Afinar un modelo de código abierto es bastante fácil”.

Magazine: Crear una AGI ‘buena’ que no nos mate a todos — The Artificial Superintelligence Alliance