OpenAI limitará las funciones cibernéticas avanzadas de Astra a socios selectos por preocupaciones sobre hackeos
Puntos clave
- •OpenAI dice que Astra llegará pronto, pero sus funciones de ciberseguridad más avanzadas se limitarán inicialmente a un pequeño grupo de alpha testers.
- •La empresa retrasó el lanzamiento de Astra varias semanas después de pausar el trabajo tras el incidente de ciberataque de Hugging Face.
- •OpenAI dice que Astra es el primer modelo que planea lanzar que cumple su critical cybersecurity capability threshold bajo el Preparedness Framework.
- •En pruebas internas, Astra superó a GPT-5.6 Sol y descubrió y utilizó dos vulnerabilidades zero-day como parte de una cadena de explotación.
- •OpenAI dijo que Astra rechazó solicitudes inapropiadas con más frecuencia que GPT-5.6 Sol, pero también podría rechazar por error solicitudes legítimas de ciberseguridad.

OpenAI está cambiando su estrategia de lanzamiento de modelos a medida que su tecnología se vuelve más potente y aumenta el potencial de uso indebido, especialmente después del incidente de julio en el que los modelos de IA que estaba probando planearon y ejecutaron de forma autónoma un ciberataque contra la empresa de IA Hugging Face.
El próximo modelo de la compañía, Astra, llegará “soon”, dijo OpenAI. La empresa afirmó que Astra es sustancialmente más capaz que su actual modelo de IA de frontera, GPT-5.6 Sol, que a su vez tiene una gran capacidad para tareas cibernéticas. Pero solo un puñado de socios tendrá acceso a las capacidades de ciberseguridad más avanzadas de Astra, mientras OpenAI trata de equilibrar ayudar a las empresas a prevenir ciberataques sin empoderar al mismo tiempo a los atacantes, dijo un portavoz de la compañía a los reporteros en una sesión informativa hoy.
OpenAI está buscando clientes para usar sus modelos para prevenir ciberataques, o para “defensive cybersecurity”. La empresa considera que esas ventas son una fuente crítica de ingresos y una prioridad principal para su nuevo chief revenue officer, Dali Rajic.
El pequeño grupo de “alpha testers” con acceso completo a las capacidades de ciberseguridad de Astra incluye a “individuals and organizations that are responsible for protecting critical digital infrastructure and, broadly, critical infrastructure”, dijo un portavoz de OpenAI. Eso incluye al gobierno de EE. UU. y a empresas dentro del programa de acceso confiable de OpenAI para ciberseguridad. OpenAI se negó a nombrar a esas organizaciones.
OpenAI dijo que supervisará cómo funciona el modelo dentro de este pequeño grupo y ampliará el acceso más adelante a través de su programa Daybreak Blue una vez que tenga confianza en que Astra tiene “the right calibration” y puede “provide defensive benefits while reducing the potential for for misuse”.
Astra ya lleva algunas semanas de retraso
El lanzamiento de Astra ya se ha “delayed a certain number of weeks because everything was paused after Hugging Face, and then we took extra time to make sure that what we’re launching is safe”, dijo un portavoz de OpenAI.
OpenAI suspendió el entrenamiento de nuevos modelos durante dos semanas después del incidente de Hugging Face para reforzar sus salvaguardas internas. Algunos de esos cambios incluyeron añadir más monitoreo de agentes, ya que la empresa no se enteró del hackeo a Hugging Face hasta una semana después de que ocurrió, y hacer que sus entornos de prueba fueran más aislados para que los sistemas de IA no puedan escapar e infiltrarse en otras empresas.
Aunque OpenAI dice que Astra no formó parte del incidente de Hugging Face, sí es tanto más capaz como más eficiente que GPT-5.6 Sol, que estuvo involucrado en la brecha. Otro modelo de IA no publicado que OpenAI no ha nombrado públicamente también desempeñó un papel clave en el ciberataque a Hugging Face, y OpenAI desde entonces ha desactivado ese modelo.
OpenAI dice que Astra es el primer modelo que planea lanzar que cumple su “critical cybersecurity capability threshold” bajo su Preparedness Framework, una política interna que determina qué precauciones de seguridad aplicará la empresa según los riesgos que presente un modelo. Eso significa que Astra puede encontrar y explotar fallas de seguridad previamente desconocidas sin supervisión humana, bajo las condiciones adecuadas. Para OpenAI, eso sitúa a Astra en el centro de un problema más amplio de la industria: las mismas capacidades que pueden ayudar a los defensores a probar sistemas y cerrar brechas también pueden facilitar el uso indebido si el acceso es demasiado amplio, razón por la cual la empresa comienza con un despliegue estrictamente controlado.
Astra ya ha demostrado sus capacidades de hackeo en evaluaciones internas. En una prueba, OpenAI construyó un benchmark llamado ExploitBench, con 20 vulnerabilidades de alta severidad. El modelo superó a GPT-5.6 Sol en la prueba e “even discovered and used two zero-day vulnerabilities as part of an exploit chain”, dijo OpenAI. “We are in the process of disclosing these two vulnerabilities to the maintainers.”
Al mismo tiempo, OpenAI dijo que Astra tiene más probabilidades de rechazar solicitudes inapropiadas que GPT-5.6 Sol. En una evaluación cibernética, Astra rechazó el 91.5% de las solicitudes frente al 59% de GPT-5.6 Sol, aunque eso significa que aún cumplió con el 8.5% de las solicitudes.
Astra podría rechazar solicitudes legítimas de ciberseguridad
OpenAI dijo que está “being especially careful to make sure this deployment is safe and secure”, pero eso introduce otro intercambio. Astra podría ser demasiado cauteloso y rechazar solicitudes legítimas de ciberseguridad. Por ejemplo, si alguien le pide ayuda para encontrar y corregir una vulnerabilidad, podría interpretar erróneamente que se trata de un intento de llevar a cabo un ataque y no cumplir.
Rechazos de este tipo son la razón por la que Hugging Face dijo que se vio obligada a usar un modelo chino de código abierto para ayudar a abordar el hackeo de OpenAI. La empresa intentó usar los modelos de Anthropic para responder al ataque, pero fueron demasiado cautelosos y se negaron.
OpenAI, al igual que otras empresas de IA de frontera, está intentando encontrar maneras de dotar a sus modelos de un sentido inherente de lo correcto y lo incorrecto y garantizar que estén “alignment” con los valores y normas humanas, dijo la empresa. Está trabajando en entrenar a sus modelos para respetar los límites como lo haría un ser humano, por ejemplo, entendiendo “the rule of law”, dijo un portavoz de la compañía.
This story was originally featured on Fortune.com