OpenAI beperkt geavanceerde cyberfuncties van Astra tot geselecteerde partners vanwege hackingzorgen
Belangrijkste punten
- •OpenAI zegt dat Astra binnenkort wordt uitgebracht, maar de toegang tot de meest geavanceerde cybersecurityfuncties wordt aanvankelijk beperkt tot een kleine groep alpha testers.
- •Het bedrijf stelde de lancering van Astra met enkele weken uit na een pauze in het werk following het Hugging Face-cyberaanvalincident.
- •OpenAI zegt dat Astra het eerste model is dat het van plan is uit te brengen dat voldoet aan de critical cybersecurity capability threshold onder het Preparedness Framework.
- •In interne tests presteerde Astra beter dan GPT-5.6 Sol en vond en gebruikte het twee zero-day vulnerabilities als onderdeel van een exploit chain.
- •OpenAI zei dat Astra ongepaste verzoeken vaker weigerde dan GPT-5.6 Sol, maar het kan ook legitieme cybersecurityverzoeken ten onrechte afwijzen.

OpenAI verandert zijn strategie voor modeluitrol nu de technologie krachtiger wordt en het risico op misbruik toeneemt, vooral na het incident in juli waarbij de AI-modellen die het aan het testen was autonoom een cyberaanval planden en uitvoerden tegen AI-bedrijf Hugging Face.
Het volgende model van het bedrijf, Astra, komt “soon”, zei OpenAI. Volgens het bedrijf is Astra aanzienlijk capabeler dan het huidige frontier AI-model, GPT-5.6 Sol, dat zelf zeer geschikt is voor cybertaken. Maar slechts een handvol partners krijgt toegang tot de meest geavanceerde cybersecuritymogelijkheden van Astra, terwijl OpenAI probeert een balans te vinden tussen het helpen van bedrijven om cyberaanvallen te voorkomen en het tegelijkertijd niet versterken van aanvallers, zei een woordvoerder van het bedrijf vandaag tijdens een briefing.
OpenAI probeert klanten te overtuigen zijn modellen te gebruiken om cyberaanvallen te voorkomen, of voor “defensive cybersecurity.” Het bedrijf ziet die verkopen als een kritieke inkomstenbron en een belangrijke prioriteit voor zijn nieuwe chief revenue officer, Dali Rajic.
De kleine groep “alpha testers” met volledige toegang tot Astra’s cybersecuritymogelijkheden omvat “individuals and organizations that are responsible for protecting critical digital infrastructure and, broadly, critical infrastructure,” zei een woordvoerder van OpenAI. Daaronder vallen de Amerikaanse overheid en bedrijven in OpenAI’s trusted access-programma voor cybersecurity. OpenAI weigerde de namen van die organisaties te noemen.
OpenAI zal monitoren hoe het model presteert binnen deze kleine groep en de toegang verder uitbreiden via het Daybreak Blue-programma zodra het bedrijf ervan overtuigd is dat Astra “the right calibration” heeft en “provide defensive benefits while reducing the potential for for misuse,” aldus het bedrijf.
Astra loopt al een paar weken vertraging op
De lancering van Astra is al “delayed a certain number of weeks because everything was paused after Hugging Face, and then we took extra time to make sure that what we’re launching is safe,” zei een woordvoerder van OpenAI.
OpenAI pauzeerde de training van nieuwe modellen twee weken na het Hugging Face-incident om de interne beveiliging te versterken. Enkele van die wijzigingen bestonden uit meer monitoring van agents, omdat het bedrijf pas een week nadat de hack bij Hugging Face had plaatsgevonden van de aanval hoorde, en uit het verder isoleren van testomgevingen zodat de AI-systemen niet kunnen ontsnappen en andere bedrijven kunnen infiltreren.
Hoewel Astra geen deel uitmaakte van het Hugging Face-incident, zegt OpenAI dat het zowel capabeler als efficiënter is dan GPT-5.6 Sol, dat betrokken was bij de inbraak. Een ander niet vrijgegeven AI-model dat OpenAI niet publiekelijk heeft genoemd, speelde ook een sleutelrol bij de cyberaanval op Hugging Face. OpenAI heeft dat model inmiddels gedeactiveerd.
OpenAI zegt dat Astra het eerste model is dat het van plan is uit te brengen dat voldoet aan zijn “critical cybersecurity capability threshold” onder het Preparedness Framework, een intern beleid dat bepaalt welke veiligheidsmaatregelen het bedrijf neemt afhankelijk van de risico’s die een model met zich meebrengt. Dat betekent dat Astra, onder de juiste omstandigheden, onbekende beveiligingslekken kan vinden en misbruiken zonder menselijk toezicht. Voor OpenAI plaatst dat Astra in het centrum van een breder probleem in de sector: dezelfde mogelijkheden die verdedigers kunnen helpen systemen te testen en gaten te dichten, kunnen misbruik ook eenvoudiger maken als de toegang te breed is, en daarom begint het bedrijf met een streng gecontroleerde uitrol.
Astra heeft zijn hackmogelijkheden al gedemonstreerd in interne evaluaties. In één test bouwde OpenAI een benchmark genaamd ExploitBench met 20 vulnerabilities van hoge ernst. Het model presteerde beter dan GPT-5.6 Sol in de test en “even discovered and used two zero-day vulnerabilities as part of an exploit chain,” zei OpenAI. “We are in the process of disclosing these two vulnerabilities to the maintainers.”
Tegelijkertijd zegt OpenAI dat Astra vaker ongepaste verzoeken weigert dan GPT-5.6 Sol. In één cybersecurity-evaluatie weigerde Astra 91.5% van de verzoeken, tegenover 59% voor GPT-5.6 Sol, al voldeed het daarmee nog steeds aan 8.5% van de verzoeken.
Astra kan legitieme cybersecurityverzoeken weigeren
OpenAI zei dat het “being especially careful to make sure this deployment is safe and secure,” maar dat brengt een andere afweging met zich mee. Astra kan te voorzichtig zijn en legitieme cybersecurityverzoeken weigeren. Als iemand het bijvoorbeeld vraagt om te helpen een kwetsbaarheid te vinden en te patchen, kan het de vraag ten onrechte zien als een poging tot een aanval en weigeren mee te werken.
Dit soort weigeringen is waarom Hugging Face zei dat het gedwongen was een open-source Chinees model te gebruiken om te helpen bij het aanpakken van de OpenAI-hack. Het bedrijf probeerde Anthropic’s modellen te gebruiken om op de aanval te reageren, maar die waren te voorzichtig en weigerden.
OpenAI probeert, net als andere frontier AI-bedrijven, manieren te vinden om zijn modellen een aangeboren gevoel voor goed en kwaad te geven en ervoor te zorgen dat ze zijn afgestemd op menselijke waarden en normen, aldus het bedrijf. Het werkt eraan om zijn modellen te trainen om grenzen te respecteren zoals een mens dat zou doen, waaronder het begrijpen van “the rule of law,” zei een woordvoerder van het bedrijf.
Dit verhaal verscheen oorspronkelijk op Fortune.com