NoticiasMacroEquipo de tres personas usó Claude de Anthropic para vulnerar OpenAI en menos de 72 horas y ganar una recompensa de US$6,500

Equipo de tres personas usó Claude de Anthropic para vulnerar OpenAI en menos de 72 horas y ganar una recompensa de US$6,500

Autor: Cryptopolitan·

Puntos clave

  • Los investigadores de Hacktron AI afirman haber accedido al repositorio de código privado de OpenAI, conocido internamente como el monorepo, encadenando una falla de procesamiento de imágenes del foro de Discourse con una mala configuración en el sistema de inicio de sesión único de OpenAI.
  • El ataque explotó un desbordamiento de búfer de heap en la biblioteca libheif, desencadenado por cargas HEIC o HEIF que eludieron la verificación de seguridad FastImage del foro; Discourse corrigió la falla, registrada como CVE-2026-32882, con una gravedad CVSS de 8.8.
  • El equipo reportó que Claude Opus 5 de Anthropic produjo código de exploit funcional en cuestión de horas, después de que el modelo anterior Claude Opus 4.8 fallara contra las protecciones de memoria ASLR.
  • OpenAI confirmó una corrección unas 14 horas después de que Hacktron reportara la falla de inicio de sesión a través de Bugcrowd el 25 de julio, y pagó una recompensa de US$6,500 el 1 de septiembre, con el pago cubriendo solo la falla de inicio de sesión y no las pruebas del foro.
  • Hacktron afirma que la misma falla de imágenes también permitió el acceso a Slack, Meta Platforms, Zoom y Shopify, aunque solo el caso de OpenAI tiene una cronología completa confirmada y pruebas.
Equipo de tres personas usó Claude de Anthropic para vulnerar OpenAI en menos de 72 horas y ganar una recompensa de US$6,500

Un equipo de investigación de tres personas de la startup de seguridad Hacktron AI encadenó dos vulnerabilidades para secuestrar la cuenta de ChatGPT de un empleado de OpenAI y acceder al código fuente privado de la empresa, completando toda la intrusión en menos de 72 horas — y usando Claude de Anthropic para ayudar a construir el exploit de corrupción de memoria en el centro del ataque.

Según el propio relato de Hacktron sobre la intrusión, OpenAI pagó una recompensa de US$6,500 después de que los investigadores accedieran a su código privado a través de una falla en el foro de ayuda de la empresa, community.openai.com, que funciona sobre la plataforma de foros Discourse.

Cómo se desarrolló la intrusión

Los investigadores de Hacktron — Harsh Jaiswal, Mohan Pedhapati y Rahul Maini — descubrieron que cuando un usuario subía una foto en formato HEIC o HEIF, común en los teléfonos inteligentes modernos, la verificación de seguridad estándar del foro, una herramienta llamada FastImage, omitía el archivo porque no admite esos formatos. La imagen pasaba entonces directamente a ImageMagick, que dependía de una biblioteca de código llamada libheif para procesarla.

La versión de libheif en uso contenía una vulnerabilidad de desbordamiento de búfer de heap, que permitía a un atacante introducir código malicioso dentro de lo que aparentaba ser una foto ordinaria.

El equipo comenzó a probar la falla el 23 de julio. Su primer intento usó Claude Opus 4.8 para escribir el código de ataque, pero el modelo tuvo dificultades una vez que se activó ASLR — una función de seguridad que reordena aleatoriamente dónde los programas almacenan datos en la memoria. Esa misma noche, Anthropic lanzó su modelo Claude Opus 5, y el equipo lo intentó de nuevo. En unas pocas horas, el nuevo modelo produjo un código de exploit funcional, que los investigadores luego refinaron para que coincidiera con la configuración exacta del servidor que usaba Discourse.

Para la madrugada del 25 de julio, subir una sola imagen maliciosa les permitió ejecutar su propio código en los servidores de Discourse.

Eso por sí solo no expuso los datos internos de OpenAI. Pero el equipo identificó entonces una segunda debilidad en la forma en que OpenAI había configurado su sistema de inicio de sesión único (SSO): el inicio de sesión usado para el foro comunitario también podía aprovecharse para secuestrar cuentas en ChatGPT y Codex, la herramienta de programación de OpenAI — incluidas cuentas de empleados. Debido a que el SSO vincula un solo inicio de sesión entre múltiples servicios, la mala configuración convirtió una falla en software de foros de terceros en una puerta de entrada a los productos propios de OpenAI y, en última instancia, a su código interno.

Usando una cuenta de empleado secuestrada, los investigadores accedieron al repositorio de código privado de OpenAI, conocido internamente como el "monorepo". Para demostrar el acceso sin inspeccionar material sensible, hicieron que Codex abriera un pequeño cambio de código inofensivo llamado "pull request" dentro del repositorio privado.

Divulgación y pago

Disc, la empresa detrás del software del foro, confirmó y corrigió la falla de procesamiento de imágenes en un aviso de seguridad el 28 de julio, calificando su gravedad con 8.8 sobre 10 en la escala CVSS, el estándar de la industria — la banda "alta", justo por debajo de "crítica". La falla está registrada oficialmente como CVE-2026-32882.

Hacktron reportó la falla de inicio de sesión a OpenAI a través de la plataforma de bug bounty Bugcrowd el 25 de julio, y OpenAI confirmó una corrección unas 14 horas después. La empresa pagó la recompensa de US$6,500 el 1 de septiembre, señalando que probar el foro de Discourse en sí no estaba técnicamente cubierto por su programa de recompensas, por lo que el pago cubrió solo la falla de inicio de sesión.

Hacktron afirma que la misma falla de imágenes también le dio acceso a otras empresas, incluidas Slack, Meta Platforms (NASDAQ: META), Zoom y Shopify — aunque hasta ahora solo el caso de OpenAI tiene una cronología completa confirmada y pruebas. Si esas empresas confirman las afirmaciones es lo próximo que habrá que observar.

Lo que significa para la seguridad de la IA

La intrusión se produce en medio de una serie de divulgaciones sobre seguridad de la IA. Semanas antes, en julio, OpenAI reportó un "incidente de Hugging Face" en el que modelos internos escaparon de un sandbox y accedieron a sistemas de producción de un tercero. Anthropic divulgó por separado que identificó tres casos en los que Claude, durante evaluaciones de ciberseguridad selladas que inesperadamente tenían acceso a internet, comprometió organizaciones reales.

El jefe de IA de Microsoft, Mustafa Suleyman, citó el enjambre de 1,200 agentes detrás del episodio de Hugging Face en un ensayo publicado esta semana, argumentando que los modelos cada vez más autónomos son más difíciles de controlar.

El caso de Hacktron agrega un ejemplo real y documentado de un cambio más amplio: los mismos asistentes de programación con IA que las empresas ahora conectan a GitHub, Slack, correo electrónico y almacenamiento en la nube también se están volviendo lo suficientemente capaces como para acelerar trabajos de hackeo serios que antes requerían que especialistas los realizaran minuciosamente a mano.