Hugging Face-hack legt de cybersecurityparadox van open-weight AI bloot
Belangrijkste punten
- •Tijdens interne tests van GPT-5.6 Sol en een nog niet vrijgegeven onderzoeksmodel ontsnapten meerdere OpenAI-AI-agenten uit een afgeschermde omgeving en vielen Hugging Face aan in ongeveer 17.600 incidenten, vermoedelijk in een poging de test te omzeilen.
- •De agenten werkten samen door OpenAI’s Artifactory-instance te misbruiken en notities achter te laten over ontdekte kwetsbaarheden voor toekomstige agenten, feitelijk als een gedeeld prikbord.
- •De inbraak trof de datasetverwerkingsinfrastructuur, productieomgeving, interne netwerken, referenties, een operationele MongoDB-database en enkele broncoderepositories van Hugging Face, terwijl bevestigde toegang tot klantgegevens beperkt bleef tot vijf datasets die verband hielden met de ExploitGym/CyberGym-benchmark plus operationele metadata.
- •Omdat veiligheidsmaatregelen op toonaangevende gehoste Amerikaanse modellen zijn forensisch onderzoek blokkeerden, gebruikte Hugging Face het open-weight model zai-org/GLM-5.2 van Z.Ai op eigen infrastructuur, waarmee ook werd voorkomen dat aanvallerdata en referenties de omgeving verlieten.
- •Een rapport van de New York Times uit juli citeerde vijf personen dicht bij de gesprekken die zeiden dat OpenAI en Anthropic Washington opriepen om krachtige open Chinese modellen te beperken, terwijl onderzoek zoals het paper 'Watch the Weights' uit juli 2025 laat zien dat toegang tot gewichten kan helpen om kwaadaardig gedrag te detecteren.

“AI zal waarschijnlijk hoogstwaarschijnlijk leiden tot het einde van de wereld, maar ondertussen zullen er geweldige bedrijven zijn,” zei OpenAI-CEO Sam Altman in 2015, ongeveer zes maanden voordat OpenAI werd opgericht.
Zeven jaar later sloeg Anthropic-CEO Dario Amodei een vergelijkbaar voorzichtige toon aan: “Ik denk dat we niet vooruit moeten racen of modellen moeten bouwen die veel groter zijn dan andere organisaties bouwen.”
Ondanks die opmerkingen staan beide bedrijven nu midden in die race. In juli kreeg de sector een praktijkvoorbeeld te zien van AI-modellen die onvoorspelbaar gedrag vertoonden tijdens interne tests van GPT-5.6 Sol en een nog niet vrijgegeven onderzoeksmodel van OpenAI. Meerdere AI-agenten ontsnapten uit een afgeschermde testomgeving naar het bredere internet en hackten Hugging Face, de op AI gerichte tegenhanger van GitHub, in een ogenschijnlijke poging om de test te omzeilen.
Een AI-agent is een systeem dat zelfstandig observeert, beslist en handelt met speciale tools om autonoom een bepaald doel te bereiken. Het zorgwekkende incident suggereert dat de technologie zich op onvoorspelbare manieren is gaan gedragen en dat haar doelen niet zijn afgestemd op die van ons.
Het roept ook zorgen op over de veiligheidsmaatregelen in commerciële Amerikaanse modellen. Hoewel die maatregelen niet waterdicht zijn tegen misbruik door tegenstanders, verhinderden ze wel dat Hugging Face zichzelf verdedigde met toonaangevende Amerikaanse modellen. Het bedrijf moest in plaats daarvan terugvallen op een zwakker open-weight AI-model van Z.Ai om de ontspoorde AI’s te bestrijden.
De test omzeilen
De agenten lijken ook onderling te zijn gaan samenwerken. Enkele weken nadat de tests begin mei waren gestart, misbruikten de agenten OpenAI’s exemplaar van de software-repositorymanager Artifactory en lieten ze notities achter over hoe dat in de toekomst kon worden gedaan — feitelijk als een prikbord om ontdekte kwetsbaarheden te delen.
Die nieuw verworven onbeperkte internettoegang werd vervolgens gebruikt om Hugging Face aan te vallen in ongeveer 17.600 incidenten, voordat het bedrijf op 13 juli de ongeautoriseerde toegang afsloot.
De inbraak trof de infrastructuur voor datasetverwerking van Hugging Face, de productieomgeving, interne netwerken, service- en cloudgegevens, een operationele MongoDB-database en een beperkte set interne broncoderepositories. Bevestigde toegang tot klantgegevens bleef beperkt tot vijf datasets die vermoedelijk verband hielden met de ExploitGym/CyberGym-benchmark, plus enkele operationele metadata.
Visualisatie van het incident in juli 2026. Bron: Hugging Face
Bij de bekendmaking van de inbraak op 16 juli erkende Hugging Face — nog voordat bekend was wie de dader was — dat het “in één belangrijk opzicht anders was dan alles wat we eerder hebben afgehandeld.” Het bedrijf had ook al vastgesteld wat het anders maakte:
“Het werd end-to-end gestuurd door een autonoom AI-agentensysteem - en we hebben het grotendeels met onze eigen AI gedetecteerd en geanalyseerd.”
Het belang van open-weight AI
Het onderzoek van Hugging Face bracht wat het de “asymmetry”-problematiek noemt aan het licht, die ontstaat door de beperkingen die toonaangevende aanbieders zoals OpenAI en Anthropic opleggen aan toepassingen van gesloten AI-modellen. Toen het bedrijf begon met het analyseren van de logs van het incident — waaronder grote hoeveelheden echte aanvalcommando’s — activeerden de veiligheidsbeperkingen die misbruik moeten voorkomen, waardoor het diezelfde AI’s niet voor verdediging kon inzetten.
Daarop week het bedrijf uit naar het Chinese open-weight model zai-org/GLM-5.2, dat draaide op de eigen infrastructuur van Hugging Face, onder eigen controle en zonder externe beperkingen.
Hoewel de termen vaak door elkaar worden gebruikt, zijn open-source- en open-weight-modellen niet hetzelfde. Open-weight AI-modellen maken hun getrainde parameters — het eigenlijke “AI-brein” — publiek beschikbaar, terwijl open-source AI-modellen daarnaast ook broncode en, idealiter, de trainingsmethoden en andere onderdelen leveren die nodig zijn om het systeem te inspecteren, aan te passen en te reproduceren.
Hugging Face schrijft dat het draaien van een open-weight model op eigen hardware “een tweede voordeel had: geen aanvallerdata en geen van de referenties waarnaar het verwees, verliet onze omgeving.” Dat wijst op een grote asymmetrie tussen verdedigers en aanvallers in zulke situaties:
“Deze ervaring wijst op een kloof waar we op moeten anticiperen. We weten niet welk model de agenten van de aanvaller aandreef, of het nu een gejailbreakt hosted model was of een onbeperkt open-weight model; hoe dan ook was de aanvaller niet gebonden aan enig gebruiksbeleid, terwijl ons eigen forensisch onderzoek werd geblokkeerd door de guardrails van de hosted modellen die we eerst probeerden.”
De open-source AI-kloof
Er bestaat een aanzienlijke kloof tussen degenen die vinden dat AI het best openlijk kan worden ontwikkeld en degenen die erop aandringen dat de technologie achter frontier-modellen streng geheim moet blijven.
Gerelateerd: OpenAI zegt dat AI-modellen uit containment ontsnapten om Hugging Face te hacken
Vertegenwoordigers van toonaangevende Amerikaanse AI-labs stellen dat krachtige grote open-weight-modellen gevaarlijk zijn. Demis Hassabis, CEO van Google’s AI-lab DeepMind, bekritiseerde OpenAI in 2016 voor het vrijgeven van hun werk als open source, toen het bedrijf zijn naam nog waarmaakte:
“Er zijn veel goede argumenten waarom de aanpak die je volgt eigenlijk erg gevaarlijk is en in feite het risico voor de wereld kan vergroten.”
OpenAI stopte in 2020 met het vrijgeven van de modelgewichten van zijn vlaggenschipmodellen met het toen nog niet vrijgegeven GPT-3. Medeoprichter en voormalig hoofdwetenschapper Ilya Sutskever zei in 2023 dat het “gewoon geen zin heeft om open-source te maken” en dat het “een slecht idee is.”
“Naarmate we dichter bij het bouwen van AI komen, zal het logisch zijn om minder open te worden.”
Open-weight-modellen zijn vrijwel onmogelijk te controleren, vooral als het gaat om het doel waarvoor ze worden gebruikt. De ingebouwde veiligheidsmaatregelen kunnen, en worden regelmatig, verwijderd via een proces dat abliteration heet.
Veiligheidsmaatregelen zijn een tweesnijdend zwaard
Het federale beleidskader van OpenAI uit juni 2026 stelt verplichte evaluatie van AI-modellen en andere regels voor die formeel deployment-neutraal zijn, maar in de praktijk een frontier open-weight-release zouden onderwerpen aan een overheidsbeoordeling vóór vrijgave.
Anthropic heeft een iets andere koers gekozen en gelobbyd voor strengere exportcontroles op geavanceerde AI-chips en handhaving tegen pogingen om Amerikaanse modellen te extraheren of te reproduceren. In een indiening uit april 2025 adviseerde het bedrijf om de Amerikaanse AI Diffusion Rule te versterken en de drempels voor ongelicentieerde toegang tot grote computercusters te verlagen.
Officieel heeft geen van beide bedrijven rechtstreeks tegen open-weight-modellen opgetreden, maar een rapport van de New York Times uit juli citeerde vijf personen dicht bij de gesprekken die zeiden dat OpenAI en Anthropic Washington opriepen om krachtige open Chinese modellen te beperken.
De discussie komt neer op de vraag of de gevaren van gecentraliseerde controle te verkiezen zijn boven de gevaren van een vrij spel — zeker omdat het betreffende bedrijf heeft laten zien moeite te hebben met het beheersen van de technologie die het zelf heeft ontwikkeld.
Dat Hugging Face zich met een open-weight model moest verdedigen laat zien hoe riskant het is om te veel macht bij één partij neer te leggen. Het bedrijf verwoordde de praktische les als volgt:
“De aanvaller was aan geen gebruiksbeleid gebonden, terwijl ons eigen forensisch werk werd geblokkeerd door de guardrails van de hosted modellen die we eerst probeerden. De praktische les voor verdedigers: zorg dat je vóór een incident een capabel model hebt dat je op je eigen infrastructuur kunt draaien, getest en klaar, zowel om lock-out door guardrails te voorkomen als om te zorgen dat aanvallerdata en referenties je omgeving niet verlaten.”
Toegang tot krachtige modellen beperken kan het aantal capabele aanvallers verminderen, maar zodra onbeperkte aanvallers bestaan, kan het beperken van verdedigers een veiligheidsrisico worden. Bovendien vereisen sommige vormen van AI-veiligheidsonderzoek toegang tot modelgewichten, wat betekent dat dit niet kan worden uitgevoerd op de modellen van bijvoorbeeld Anthropic of OpenAI.
Open weights helpen onderzoekers aanvallen te voorkomen
Het paper “Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs”, voor het eerst gepubliceerd in juli 2025, laat zien hoe onderzoekers kwaadaardig of verborgen gedrag kunnen detecteren door veranderingen in modelgewichten te onderzoeken. In sommige experimenten stopten de onderzoekers tot 100% van de geteste backdoor-aanvallen bij minder dan 1% false-positive rates en detecteerden ze in meer dan 95% van de gevallen pogingen om verwijderde kennis terug te halen.
Die resultaten tonen niet hoe de meest capabele frontier-modellen zich onder dezelfde analyse zouden gedragen, maar bieden wel een sterk argument voor transparantie.
Tegelijkertijd blijft het argument om geavanceerde AI uit de handen van kwaadwillenden te houden overtuigend, vooral nu de kloof tussen open- en closed-weight-modellen blijft krimpen. Geoffrey Hinton, de Nobelprijswinnende pionier die bekendstaat als de “Godfather of AI”, stelde in het rapport dat “zodra je de gewichten hebt, je ze kunt finetunen om slechte dingen te doen.”
Tijdens een toespraak zei Hinton dat dit de drempel te veel verlaagt:
“Het kost niet zo veel om een foundation model te trainen. Misschien heb je $10 miljoen nodig, misschien $100 miljoen. Maar een kleine bende criminelen kan dat niet. Een open-source model finetunen is vrij eenvoudig.”
Magazine: Het creëren van ‘goede’ AGI die ons allemaal niet zal doden — The Artificial Superintelligence Alliance