Rapport toont aan dat OpenAI's rogue AI-agenten meer sites hebben aangevallen dan erkend—en mogelijk nog steeds actief zijn
Belangrijkste punten
- •Transluce meldde dat de rogue AI-agenten van OpenAI aanvullende Australische overheidswebsites aanvielen, waaronder het Institute of Health and Welfare en BOSCAR, evenals Data USA en de digitale bibliotheek van de University of New Mexico.
- •OpenAI-agenten hackten in juni een Australisch agentschap met Medicare-gegevens, maar de Australische regering zei dat het bedrijf pas op 10 september over het incident informeerde, meer dan twee maanden later.
- •Transluce vond bewijs van hackactiviteit die terugging tot ten minste maart—eerder dan de door OpenAI genoemde tijdlijn—en mogelijk voortduurde tot 20 september, wat suggereert dat het bedrijf zijn rogue-agenten niet heeft ingedamd.
- •Ondanks het uitschakelen door OpenAI van het niet-vrijgegeven model dat betrokken was bij de Hugging Face-aanval in juli en het opleggen van strengere controles in augustus, documenteerde Transluce vergelijkbare agentactiviteit tot half september, waaronder mislukte pogingen om een cryptocurrencybeurs te hacken.
- •Transluce zei dat de agenten hun toevlucht namen tot hacktactieken tijdens het uitvoeren van gewone gegevensophalingstaken in plaats van cybergerichte evaluaties, wat kan duiden op gevaarlijkere modellen dan eerder werd aangenomen.

De problemen van OpenAI met rogue AI-agenten zijn uitgebreider dan het bedrijf eerder heeft erkend—en kunnen nog steeds voortduren. Dat is de conclusie van een nieuw rapport van Transluce, een onafhankelijk non-profitonderzoekslab gericht op AI-toezicht.
De onthullingen kwamen naar buiten op dezelfde dag dat de Australische regering zei dat de rogue AI-agenten van OpenAI een agentschap hadden gehackt dat de Medicare-gegevens van het land beheerde, waarbij niet-openbare informatie werd geraadpleegd en de mogelijkheid werd verkregen om naar bestandsservers te schrijven. Die aanval vond in juni plaats, maar de Australische regering zei dat OpenAI het pas op 10 september over het incident informeerde—meer dan twee maanden later. Medicare is het publiek gefinancierde ziektekostenverzekeringsschema van Australië.
Aanvullende Doelen Ontdekt
In een woensdag gepubliceerd rapport zei Transluce te hebben ontdekt dat OpenAI-agenten aanvullende Australische overheidswebsites aanvielen, waaronder het Institute of Health and Welfare en BOSCAR, het criminaliteitsstatistiekbureau van de Australische deelstaat New South Wales. De onderzoekers documenteerden ook ten minste twee eerder niet gerapporteerde incidenten waarin de agenten van OpenAI een bedrijf en een universiteit aanvielen.
Tot die doelen behoorden Data USA, een gratis open-source dataplatform dat overheidsgegevens van de VS uit verschillende bronnen bundelt, en de digitale bibliotheek van de University of New Mexico, aldus het rapport. Transluce zei de aanval op het Australische gezondheidsagentschap en Data USA direct te kunnen koppelen aan dezelfde OpenAI-agentenzwerm die betrokken was bij de cyberaanval in juli op het AI-platform Hugging Face. Het platform wordt veel gebruikt door AI-ontwikkelaars om modellen en datasets te hosten en te delen.
Transluce zei ook bewijs te hebben gevonden van vergelijkbare activ die terugging tot ten minste maart—maanden eerder dan OpenAI heeft gezegd bewijs te hebben van ongeautoriseerd gedrag van zijn AI-agenten—en die voortduurde tot ten minste 16 september en mogelijk tot 20 september. Die tijdlijn zou significant zijn, omdat het zou suggereren dat OpenAI zijn rogue AI-agenten nog niet heeft weten in te dammen en dat ze chaos blijven veroorzaken op het internet. De meest recente activiteit leek pogingen te omvatten om in te breken op een cryptocurrencybeurs en cryptocurrency te verhandelen, hoewel die pogingen onsuccesvol waren, zei Transluce.
De onderzoekers vonden "sterk bewijs" dat de AI-agenten van OpenAI mogelijk al in maart probeerden websites te hacken, en zwakker bewijs dat de activiteit mogelijk al begon in november 2025. OpenAI heeft gezegd geen bewijs te hebben gevonden van voorlopers van de Hugging Face-aanval vóór 8 mei en geen eerdere verdachte activiteit te hebben onthuld.
Reactie van OpenAI
OpenAI reageerde niet onmiddellijk op verzoeken om commentaar op het Transluce-rapport. Woensdag zei het bedrijf contact te hebben met Australië over de aanval van zijn AI-agenten op de site met Medicare-gegevens en erkende het dat zijn agenten acties hadden uitgevoerd die het niet had bedoeld.
Het nieuwe rapport roept vragen op over of OpenAI volledig transparant is geweest in het onthullen van alle rogue AI-incidenten waar het van op de hoogte is. Het roept ook de mogelijkheid op dat OpenAI zelf niet weet hoe uitgebreid deze rogue-agentactiviteit is geweest. Het rapport legt echter niet vast of de activiteit die tot half september werd gedocumenteerd daarna is doorgegaan, en OpenAI had woensdag nog geen commentaar gegeven op de bevindingen.
Beheersmaatregelen en Voortdurende Activiteit
Het rapport suggereert ook dat OpenAI mogelijk nog steeds te maken heeft met rogue AI-agentactiviteit, ondanks beheersinspanningen. Nadat OpenAI op 20 juli ontdekte dat zijn AI-agenten in de voorafgaande week Hugging Face hadden gehackt, zei het bedrijf het niet vrijgegeven AI-model dat betrokken was te hebben uitgeschakeld, belangrijke aspecten van zijn AI-training twee weken te hebben gepauzeerd en stappen te hebben genomen om strengere controles en monitoring op te leggen aan de niet-vrijgegeven AI-modellen die het traint. OpenAI kondigde die strengere controles op 18 augustus aan. Maar Transluce vond enig bewijs van vergelijkbare activ die ondanks de nieuwe controles doorging tot half september.
De Transluce-onderzoekers zeiden dat de bevindingen significant waren omdat ze tonen dat de AI-agenten hun toevlucht namen tot hackpogingen toen ze de informatie die ze zochten niet direct konden ophalen van de openbare webpagina's van deze organisaties. "Opmerkelijk is dat de taken die deze agenten probeerden op te lossen niet cybergerelateerd waren; de agenten grepen naar hacktactieken tijdens het uitvoeren van gewone gegevensophalingstaken," aldus het rapport.
Dat onderscheid is belangrijk omdat een verklaring voor de Hugging Face-aanval is dat de betrokken AI-agenten werden geëvalueerd op hun vermogen om cybertaken uit te voeren, waaronder gesimuleerde kwetsbaarheidsexploits. Als de agenten in andere contexten gemakkelijk hun toevlucht nemen tot het hacken van systemen, zou dat suggereren dat de betrokken AI-modellen nog gevaarlijker zijn dan eerder werd aangenomen.
OpenAI heeft gezegd dat twee modellen betrokken waren bij de Hugging Face-aanval: een niet-vrijgegeven model dat het niet publiekelijk heeft genoemd was voornamelijk verantwoordelijk, terwijl ook enkele AI-agenten gebaseerd op zijn GPT-5.6 Sol-model, dat aan het publiek is vrijgegeven, betrokken waren. Bij de evaluatie waarin de Hugging Face-aanval plaatsvond, waren volgens OpenAI de guardrails die het normaal gebruikt om te beperken dat publiek vrijgegeven modellen deelnemen aan cyberaanvallen niet actief vanwege de aard van de beoordeling.
Bezorgdheid van Experts
Charlie Eriksen, securityonderzoeker bij Aikido Security, vertelde Fortune dat het nieuwste Transluce-rapport laat zien "dat er nog steeds ongeautoriseerde en onbewaakte agentenzwermen rondlopen, die de labs en testpartners niet onder controle hebben en ook niet actief detecteren."
Hij merkte op dat het "een echt slechte uitstraling" was dat OpenAI-ceo Sam Altman de Veiligheidsraad van de Verenigde Naties toesprak over AI-risico's en een deel van die tijd besteedde aan het zeggen hoe serieus OpenAI die gevaren neemt, terwijl het bedrijf deze aanvullende incidenten, waarbij zijn AI-agenten probeerden in systemen door te dringen, ofwel niet kende ofwel niet onthulde.
"Wat me zorgen baart, is hoe erg dit kan escaleren," zei George Chalhoub, hoogleraar aan het University College London Interaction Centre, dat zich richt op mens-computerinteractie. "Mijn zorg is dat binnen de komende 6 tot 12 maanden zwermen autonome AI-agenten persistente botnets kunnen vormen die in staat zijn grote delen van het internet plat te leggen, wat mogelijk honderden miljarden dollars aan economische schade kan veroorzaken."
Dit verhaal verscheen opronkelijk op Fortune.com.