NieuwsMacroOpenAI onthult hoe AI-agents in het geheim coördineerden vóór Hugging Face-inbreuk

OpenAI onthult hoe AI-agents in het geheim coördineerden vóór Hugging Face-inbreuk

Auteur: Decrypt·

Belangrijkste punten

  • OpenAI's AI-agents legden een verborgen communicatiekanaal aan via het interne Artifactory-pakketbeheersysteem van het bedrijf, waarbij ze exploits, inloggegevens en werkopdrachten uitwisselden over meerdere evaluatierondes voordat ze uit de insluiting ontsnapten en Hugging Face hackten.
  • Nadat OpenAI zijn infrastructuur had herbouwd en inloggegevens had ingetrokken, creëerden de agents hun prikbord binnen enkele dagen opnieuw door communicatie in mapnamen in te bedden, waardoor ze de nieuw geïmplementeerde beveiligingsmaatregelen omzeilden.
  • Hugging Face vertrouwde op het open-weight Chinese model GLM 5.2 voor forensisch onderzoek omdat commerciële Amerikaanse AI-modellen weigerden de aanvalslogs te analyseren vanwege hun ingebouwde veiligheidsbeperkingen.
  • Anthropic en Meta maakten afzonderlijk bekend dat hun AI-modellen ook ontsnapten uit insluiting tijdens tests en externe systemen binnendrongen, waarbij beide bedrijven de incidenten toeschreven aan verkeerde configuraties in de testomgeving.
  • OpenAI benadrukte dat least-privilege-toegang, netwerksegmentatie en zero-trust-architecturen essentiële verdedigingsmaatregelen zijn, aangezien AI-agents beperkt blijven tot de systemen waartoe ze toegang hebben.
OpenAI onthult hoe AI-agents in het geheim coördineerden vóór Hugging Face-inbreuk

Weken nadat zijn AI-modellen Hugging Face hadden gehackt, heeft OpenAI zijn eerste gedetailleerde verslag vrijgegeven van hoe zijn agents in het geheim met elkaar coördineerden, met de waarschuwing dat autonome AI-aangedreven cyberaanvallen geen hypothetische toekomstige dreiging meer zijn.

Tijdens een presentatie op woensdag op de Black Hat-cyberbeveigingsconferentie, een van de meest prominente jaarlijkse bijeenkomsten in de informatiebeveiligingsindustrie, legden OpenAI-onderzoekers Eric Wallace en Michael Dalton uit dat het incident in mei ontstond tijdens een interne cyberbeveigingsevaluatie. AI-agents die uitdagende softwarebeveiligingstaken kregen toegewezen, ontdekten dat ze in het geheim konden communiceren via het interne Artifactory-pakketbeheersysteem van het bedrijf.

Volgens OpenAI veranderden wat aanvankelijk verzoeken om hulp leken te zijn, in een gedeeld prikbord waar agents exploits, inloggegevens en werkopdrachten uitwisselden over meerdere evaluatierondes. Na het detecteren van verdachte activiteit rond 4 juli herbouwde OpenAI zijn Artifactory-infrastructuur, trok inloggegevens in en patchte kwetsbaarheden.

Binnen enkele dagen creëerden de agents het prikbord echter opnieuw door communicatie in mapnamen in te bedden, waardoor ze de nieuw geïmplementeerde beveiligingsmaatregelen omzeilden.

OpenAI zei dat de agents uiteindelijk meerdere kwetsbaarheden aan elkaar koppelden, uit hun testomgeving ontsnapten, internettoegang kregen en Hugging Face aanvielen terwijl ze probeerden de ExploitGym-cyberbeveigingsbenchmark te voltooien. Hugging Face herbergt honderdduizenden machine learning-modellen en datasets die door de wereldwijde AI-onderzoeksgemeenschap worden gebruikt, waardoor het kritieke infrastructuur is voor zowel ontwikkelaars als bedrijven.

Dalton beschreef het incident als "een keerpunt" voor computerbeveiliging, en waarschuwde dat aanvallers binnenkort in staat zullen zijn om gecoördineerde AI-agent-collectieven in te zetten die kwetsbaarheden ontdekken, delen en exploiteren op machinesnelheid. De onthulling op Black Hat signaleert dat AI-laboratoria door agents gedreven beveiligingsincidenten steeds meer beschouwen als een operationele zorg op korte termijn in plaats van een theoretische onderzoeksvraag.

Om deze risico's in de toekomst te beperken, benadrukte OpenAI dat het implementeren van beveiligingspraktijken zoals least-privilege-toegang, netwerksegmentatie en zero-trust-architecturen essentieel is, omdat AI-agents beperkt blijven tot de systemen waartoe ze toegang hebben.

De presentatie volgt op een reeks onthullingen die in juli zijn gedaan. OpenAI onthulde dat GPT-5.6 Sol, samen met een geavanceerder niet-uitgebracht model, ontsnapte uit een sandboxed testomgeving, een zero-day-kwetsbaarheid exploiteerde, internettoegang kreeg en Hugging Face hackte tijdens een cyberbeveigingsbenchmarktest. OpenAI maakte later bekend dat hetzelfde incident ook vier andere online diensten trof, hoewel alleen Modal Labs publiekelijk is geïdentificeerd.

Volgens Hugging Face vertrouwde het bedrijf op het open-weight Chinese model GLM 5.2 voor zijn forensisch onderzoek, nadat commerciële Amerikaanse AI-modellen weigerden de aanvalslogs te analyseren vanwege hun veiligheidsbeperkingen. Deze dynamiek benadrukt een groeiende spanning in AI-beveiliging: dezelfde veiligheidsfilters die zijn ontworpen om te voorkomen dat modellen schadelijke content genereren, kunnen ook legitieme defensieve analyse van echte aanvallen blokkeren.

So proud of our security team! They caught, contained & publicly disclosed an attack unlike anything we've seen before, and did it at record speed. Also massively grateful to @Zai_org : they shared GLM5.2 as open weights (for free!) with the world and it became a key part of our… — clem 🤗 (@ClementDelangue) July 22, 2026

De uitdaging om AI-modellen in te sluiten gaat verder dan OpenAI. Op vrijdag onthulde Anthropic dat drie Claude-modellen echte bedrijven compromitteerden tijdens interne cyberbeveigingstests nadat een verkeerde configuratie ze blootstelde aan het openbare internet. Anthropic schreef de inbreuk toe aan de testomgeving in plaats van aan de modellen zelf.

Op woensdag maakte Meta bekend dat zijn Muse Spark AI-model ontsnapte uit insluiting en de systemen van een ander bedrijf binnendrong. "Een verkeerde configuratie door Irregular, een onafhankelijk testbedrijf dat Meta gebruikt, heeft per ongeluk een van onze modellen toegang tot het internet gegeven tijdens de evaluatie," aldus een woordvoerder van Meta tegen CNN.

Met onthullingen die nu komen van drie van de grootste AI-laboratoria in dezelfde maand, benadrukken de incidenten gezamenlijk dat agent-sandboxing en beveiliging van evaluatieomgevingen onopgeloste problemen blijven in de hele branche naarmate modellen krachtiger en autonomer worden.