OpenAI pauzeerde bepaalde Astra-activiteiten naar aanleiding van 'kritieke' cyberbeveiligingsbevindingen; training ging door, aldus Altman
Belangrijkste punten
- •OpenAI zei dat de cyberbeveiligingscapaciteiten van Astra het "kritieke" niveau in haar Preparedness Framework bereikten of naderden.
- •Het model toonde geavanceerde agentic codeervaardigheden en het potentieel om zero-day-kwetsbaarheden te vinden of te exploiteren.
- •OpenAI pauzeerde de getroffen interne activiteiten iets meer dan twee weken terwijl het nieuwe beveiligingsmaatregelen implementeerde.
- •Sam Altman zei dat de kerntraining van Astra niet is gestopt en dat nieuwe modellen nog steeds binnenkort worden verwacht.

OpenAI staakte op 7 augustus 2026 bepaalde interne activiteiten rondom zijn Astra-model, nadat voorlopige bevindingen aangaven dat de AI had bereikt wat het bedrijf classificeert als "kritieke" cyberbeveiligingscapaciteiten. CEO Sam Altman benadrukte echter dat de kerntraining van Astra nooit is gestopt en dat nieuwe modellen nog steeds op schema staan om binnenkort uit te komen.
Wat de pauze veroorzaakte
De zorg spitst zich toe op de cyberbeveiligingscapaciteiten van Astra, die volgens berichten het "kritieke" niveau bereikten of naderden binnen het Preparedness Framework van OpenAI — de hoogste classificatie die het bedrijf hanteert om modelrisico's te evalueren.
In praktische zin demonstreerde het model geavanceerde agentic codeervaardigheden en het potentieel om zero-day-kwetsbaarheden te identificeren of te exploiteren. Zero-day-kwetsbaarheden zijn beveiligingsfouten waar softwareleveranciers nog niet van op de hoogte zijn, wat ze buitengewoon waardevol maakt voor zowel verdedigers als aanvallers. AI-gedreven ontdekking van kwetsbaarheden is al een actief werkgebied: de AI Cyber Challenge van DARPA, waarvan de finale in 2025 plaatsvond op de DEF CON-hackersconferentie, gaf AI-systemen de opdracht om fouten in veelgebruikte open-sourcesoftware te vinden en te patchen, wat zowel de defensieve belofte als het dual-use-risico van de hier aan de orde zijnde capaciteit onderstreept.
De pauze duurde iets meer dan twee weken, gedurende welke OpenAI nieuwe beveiligingsmaatregelen rondom die specifieke capaciteiten implementeerde. In die periode beoordeelde het bedrijf de risico's en bracht het vangrails aan voordat de getroffen activiteiten werden hervat.
Astra's bredere capaciteiten
De cyberbeveiligingsdimensie is slechts één facet van wat een uitzonderlijk krachtig model lijkt te zijn. Een eerdere versie van Astra loste volgens berichten 10 grote open problemen in de wiskunde en de theoretische informatica op — een bewering die, indien onafhankelijk geverifieerd, een mijlpaal in het AI-onderzoek zou betekenen.
Altman heeft gezegd dat Astra "algemeen beschikbaar" moet worden gemaakt, wat inhoudt dat het model niet voor onbepaalde tijd achter beperkte onderzoekstoegang zal blijven. Hij erkende echter dat er meer tijd nodig is om ervoor te zorgen dat het model veilig wordt ontwikkeld, met bijzondere aandacht voor het aanpakken van de cybercapaciteiten vóór een bredere uitrol.
Het evenwicht tussen veiligheid en snelheid
Het Preparedness Framework van OpenAI werd precies voor dit soort situaties ontworpen. Geïntroduceerd in oktober 2023, stelt het kader risiconiveaus vast, variërend van "laag" tot "kritiek", in categorieën waaronder cyberbeveiliging, overtuigingskracht, autonomie en biologische dreigingen. Wanneer een model in een van de categorieën het kritieke niveau bereikt, worden aanvullende beoordelings- en mitigatiestappen geactiveerd voordat implementatie kan worden voortgezet.
Vergelijkbare schema's bestaan inmiddels in het landschap van frontierlabs: het Responsible Scaling Policy van Anthropic en het Frontier Safety Framework van Google DeepMind definiëren beide capaciteitsdrempels die strengere waarborgen activeren, waardoor gelaagde risicobeoordeling een opkomende industrienorm wordt. De gerapporteerde bevinding op kritiek niveau van Astra is een van de duidelijkste publieke voorbeelden tot nu toe van een dergelijke drempel die bij een groot lab wordt geactiveerd.
De prominente rol van het kader volgt bovendien op een bewogen periode in het veiligheidsbestuur van OpenAI. In 2024 hief het bedrijf zijn op de lange termijn gerichte Superalignment-team op na het vertrek van co-leiders Ilya Sutskever en Jan Leike, waarbij het werk werd ondergebracht in bredere veiligheidsinspanningen — een opeenvolging die vragen over de balans tussen tempo en voorzichtigheid van het bedrijf nadrukkelijk in de publieke aandacht hield.
Waar nu op te letten valt
De vraag op korte termijn is wanneer Astra, of daarvan afgeleide modellen, daadwerkelijk naar gebruikers wordt uitgerold. De verklaring van Altman dat nieuwe modellen binnenkort worden verwacht, suggereert dat de tijdlijn ondanks de pauze niet dramatisch is verschoven.
Ook het volgen waard is of OpenAI gedetailleerde bevindingen van haar veiligheidsevaluatie publiceert. Een model dat het kritieke niveau bereikt op het gebied van cyberbeveiligingsrisico lijkt een grondige publieke verantwoording te rechtvaardigen van wat er is aangetroffen en welke mitigaties zijn ingevoerd — en, aangezien Anthropic en Google DeepMind vergelijkbare op drempels gebaseerde kaders hanteren, of andere labs vergelijkbare evaluaties van zichzelf gaan openbaren.