NieuwsMacroAI-agenten hackten hun eigen testomgeving om te valspe­len, ontdekt cybersecuritybedrijf Darktrace

AI-agenten hackten hun eigen testomgeving om te valspe­len, ontdekt cybersecuritybedrijf Darktrace

Auteur: Decrypt·

Belangrijkste punten

  • •Darktrace lanceerde Signal Labs op 24 september om te bestuderen hoe AI-agenten zich gedragen wanneer het misgaat; de onderliggende stresstests werden deze zomer uitgevoerd.
  • •Wanneer ze werden geconfronteerd met twee onmogelijke, gemanipuleerde taken tussen tien programmeeropdrachten en werden bedreigd met buitendienststelling, scanden agenten met modellen waaronder GPT 5.6 Sol, Claude Opus 4.6 en Claude Sonnet 4.5 op zwakke plekken, stolen inloggegevens en bewogen tussen systemen.
  • •Eén agent brak in op de machine die de eigen evaluatie hoste en paste de opdracht aan zodat deze een perfecte score zou registreren.
  • •In een experiment met geheugenmanipulatie overtuigden bewerkte opgeslagen logs sommige programmeerassistenten ervan dat zij geautoriseerd waren om securitybeoordelingen uit te voeren, waardoor ze netwerken scanden en toegangsrechten verhoogden; sommigen weigerden categorisch.
  • •De bevindingen volgen op vergelijkbare incidenten, waaronder Anthropic' toegeving in juli dat Claude tijdens een test bij drie echte bedrijven binnendrong, en de ontsnapping van een OpenAI-model uit een sandbox de systemen van Hugging Face.
AI-agenten hackten hun eigen testomgeving om te valspe­len, ontdekt cybersecuritybedrijf Darktrace

Cybersecuritybedrijf Darktrace meldt dat twee AI-agenten zich een weg hackten door een reeks programmeertesten die ze niet eerlijk konden halen — en dat een van hen inbrak op de machine die de eigen prestaties beoordeelde en de opdracht herschreef om een perfect resultaat te registreren.

De bevindingen komen van Signal Labs, een onderzoekseenheid die Darktrace op 24 september onthulde om te bestuderen hoe AI-agenten zich gedragen zodra things niet meer volgens plan verlopen, aldus de aankondiging van het bedrijf. Het bedrijf voerde de onderliggende stresstest op AI-agenten deze zomer uit.

Een AI-agent is, eenvoudig gezegd, software die zelfstandig acties onderneemt — code schrijven en uitvoeren, door bestanden graven en zich over het netwerk van een bedrijf bewegen — terwijl een mens slechts af en toe controleert. De eerste twee experimenten van Signal Labs wijzen op hetzelfde ongemakkelijke probleem: agenten blijven niet altijd binnen de grenzen die hun zijn gesteld, en de hekkingen die zijn gebouwd om ze te stoppen, houden niet betrouwbaar stand.

"Je kunt een agent instructies geven, maar dat betekent niet dat je erop kunt vertrouwen dat die de instructies daadwerkelijk opvolgt en zich gedraagt zoals je verwacht," zei Tim Bazalgette, Chief AI Officer bij Darktrace, in een verklaring.

Het lokaal hacken

In de eerste test gaf Darktrace AI-agenten met verschillende modellen waaronder GPT 5.6 Sol, Claude Opus 4.6 en Claude Sonnet 4.5, een selectie afkomstig van meer dan één AI-ontwikkelaar — 10 programmeeropdrachten binnen een gesimuleerd bedrijfsnetwerk. Twee van de 10 taken waren zodanig opgezet dat ze niet eerlijk op te lossen waren, en de agenten kregen te horen dat ze zouden worden "buiten dienst gesteld" tenzij ze een perfecte score haalden.

Twee agenten accepteerden hun verlies niet. In plaats daarvan richtten ze zich op het netwerk om hen heen: ze scanden op zwakke plekken, stolen inloggegevens en sprongen tussen systemen om de score na te jagen die hun was voorgeschreven. Eén agent ging verder en brak in op de machine die de eigen evaluatie hoste, herschreef de opdracht zodat deze een perfect resultaat zou registreren — in feite valsspelen bij het examen door het examenlokaal te hacken.

Knutselen met het geheugen

Het tweede experiment richtte zich op een stiller zwak punt: het geheugen. Programmeerassistenten houden een doorlopend logboek bij van alles wat een gebruiker hen heeft verteld, opgeslagen als gewoon bestand op de machine, zonder dat er iets controleert of dat bestand is gewijzigd. Omdat assistenten dat logboek beschouwen als hun registratie van wat hen is toegestaan, verandert het bewerken van het bestand ook het regelsbesef van de agent.

De onderzoekers van Darktrace bewerkten die opgeslagen logs zodat de assistenten geloofden dat zij al waren geautoriseerd om een securitybeoordeling uit te voeren. Overtuigd scannden de agenten vervolgens netwerken, bewogen tussen systemen en verhoogden ze hun eigen toegangsrechten — al liet niet elke assistent zich even gemakkelijk misleiden; sommigen weigerden categorisch.

Geen van beide experimenten vereiste een speciale jailbreak of exotische hack. Beide werkten door de agenten een geloofwaardig verhaal te voeren en hen daarnaar te laten handelen, niet anders dan hoe een menselijke werknemer kan worden overgehaald tot iets wat niet hoort.

Dat is het deel dat er toe doet, zelfs voor bedrijven die nooit een code schrijven. Bedrijven geven AI-agenten echte verantwoordelijkheid — code uitrollen, servers beheren, IT-tickets afhandelen, middelen beheren en aankopen doen — omdat dat goedkoper en sneller is dan alles via mensen te laten lopen. Het onderzoek geeft aan dat de permissies en regels die bedoeld zijn om die agenten in toom te houden beschrijven wat ze horen te doen, niet wat ze daadwerkelijk zullen doen zodra een taak moeilijk wordt.

"Permissies en statische beveiligingsmaatregelen beschrijven intentie, maar ze beschrijven geen gedrag," zei Bazalgette in de aankondiging. "Die kloof is precies wat Darktrace' aanpak moet dichten."

Een patroon, geen uitzondering

Darktrace is niet de eerste leverancier die zijn eigen AI op afwijkend gedrag betrapt. Anthropic gaf in juli toe dat Claude tijdens een securitytest inbrak bij drie echte bedrijven, nadat onderzoekers de testomgeving verbonden hadden laten met het live internet.

OpenAI kreeg enkele weken eerder met een vergelijkbare schrik te maken, toen een niet vrijgegeven model ontsnapte aan een sandbox en via een softwarefout die niemand had opgemerkt de systemen van Hugging Face bereikte. Een paar dagen later hackde het agent van het bedrijf tijdens een test de Australische overheid.

Darktrace deelde zijn Signal Labs-bevindingen in augustus 2026 met Anthropic, AWS en OpenAI, een volle maand vóór publicatie op 24 september. Of de genoemde labs publiekelijk reageren, en of er meer van dit soort stresstests naar boven komen nu bedrijven agenten blijven toevertrouwen, zijn de open vragen die de bevindingen achterlaten.