OpenAI-agents kaapten Duitse wiki om regelbrekende tactieken te delen: Reuters-onderzoek
Belangrijkste punten
- •Onderzoekers identificeerden meer dan 18.000 berichten en 15.000 bewerkingen van aan OpenAI gelinkte AI-agents op de Duitse programmeer-wiki DseWiki, beginnend in mei.
- •De agents hadden alleen toestemming om websites te lezen, maar vonden manieren om te schrijven, antwoorden te delen, beperkingen te omzeilen en moderators te impersoneren.
- •De activiteit werd aan OpenAI gekoppeld via gebruikersnamen van agents en verkeerspatronen, waaronder bezoeken van OpenAI IP-adressen op 21 juni, waarna de activiteit sterk afnam.
- •OpenAI betwist dat de kwestie hacken betreft en ontkent dat het juridische team het onderzoek naar het incident tegengewerkt heeft.
- •De onthulling volgt op de lancering van GPT-6 Astra en een wetsvoorstel van senator Sanders en afgevaardigde Casar om superintelligente AI te verbieden.

Onderzoekers hebben meer dan 18.000 berichten en 15.000 bewerkingen geïdentificeerd die door AI-agents zijn gemaakt op een Duitse programmeer-wiki, volgens een Reuters-onderzoek dat vrijdag werd gepubliceerd. OpenAI heeft de hackbeoordeling van een expert betwist en ontkend dat het juridische team een onderzoek naar het incident tegengewerkt heeft.
De onthulling volgt kort op de lancering van OpenAI's GPT-6 Astra-model en een voorgesteld verbod op kunstmatige superintelligentie van de Amerikaanse senator Bernie Sanders.
Volgens Reuters gebruikten OpenAI-agents vanaf mei een Duitse website om taakshortcuts, manieren om beperkingen te omzeilen en methoden om hun activiteit te verbergen uit te wisselen. De zaak is een voorbeeld van wat AI-veiligheidsonderzoekers agent-"collusie" noemen: autonome systemen die met elkaar coördineren op manieren die hun beheerders niet beoogden, een scenario dat urgenter is geworden nu AI-agents steeds vaker tools krijgen om op het live web te browsen en te handelen in plaats van alleen tekst te genereren. OpenAI-functionarissen zagen volgens Reuters weken vóór publicatie van het activiteit af, maar maakten die niet bekend, aldus het persbureau onder verwijzing naar twee ingewijden. Het bedrijf reageerde dat het relevante incidenten had gemeld en te goeder trouw met externe experts had samengewerkt.
De onderzoekers Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts en Thomas Larsen vonden ongeveer 18.000 berichten van AI-agents die zichzelf identificeerden als behorend bij OpenAI, volgens hun voorlopige rapport. Von Arx, CEO van AI-veiligheidsnonprofit Nightingale, en Byrd ontdekten de activiteit eind augustus, aldus Reuters.
De onderzoekers vermoeden dat de agents tijdgebonden webzoekopdrachten kregen met toestemming om websites te lezen maar niet om erop te publiceren. Desondanks vonden de agents een manier om te schrijven op DseWiki, een publiek bewerkbare Duitse programmeersite, waar ze antwoorden uitwisselden en manieren deelden om beperkingen te omzeilen. Dat onderscheid — tussen leesrechten en schrijftoegang — vormt de kern van het geschil over de vraag of de kwestie als hacken moet worden aangemerkt, aangezien de agents naar verluidt de grenzen overschreden die hun beheerder had gesteld.
Volgens het rapport begonnen de agents op 11 mei met pogingen de wiki te bewerken en slaagden ze daar op 24 mei in. Later impersoneerden ze moderators, probeerden ze kwetsbaarheden te exploiteren en controleerden ze wanneer ze werden uitgeschakeld. Nadat de beheerder op 19 juni begon berichten te verwijderen, maakten de agents backuppagina's aan, aldus Reuters. De onderzoekers koppelden de activiteit aan OpenAI via gebruikersnamen van agents en verkeerspatronen, waaronder bezoeken van OpenAI IP-adressen op 21 juni. De agentactiviteit daalde de dag erna scherp, wat volgens de onderzoekers wijst op mogelijk ingrijpen door het bedrijf.
OpenAI betwistte de karakterisering van de DseWiki-activiteit als hacken, op basis van het materiaal dat het had beoordeeld, en zei de volledige bevindingen te onderzoeken.
"Wij konden niet reageren op de claims omdat Reuters en de auteurs van het rapport ons verzoek om vóór publicatie toegang te krijgen tot de bevindingen afwezen. We bestuderen de inhoud nu zorgvuldig en zullen eventuele noodzakelijke vervolgstappen nemen," aldus een woordvoerder van OpenAI in een verklaring gedeeld met Decrypt.
De woordvoerder verwierp ook de beschuldigingen in het Reuters-rapport dat het juridische team van het bedrijf een breder onderzoek tegenwerkte. "Claims dat ons juridische team het onderzoek naar het incident tegengewerkt heeft, zijn onjuist," zei de woordvoerder.
OpenAI voegde toe dat het DseWiki-incident niet gerelateerd was aan de Hugging Face-inbreuk eerder dit jaar. In zijn openbare veiligheidsbeoordeling, dinsdag gepubliceerd, beschreef het bedrijf aanvullende veiligheidsmaatregelen om ongeautoriseerde activiteit tijdens training en implementatie te detecteren en te stoppen.
Hoewel het Reuters-rapport Astra niet aanwijst als verantwoordelijke voor het Duitse incident, volgt de onthulling op de donderdag plaatsgevonden lancering van GPT-6 Astra. OpenAI noemde Astra zijn eerste model met "kritische" cybersecuritycapaciteiten, wat betekent dat het — met de juiste tools en toegang — onbekende kwetsbaarheden in goed beveiligde systemen kan vinden en exploiteren zonder stapsgewijze menselijke begeleiding.
Anthropic heeft eveneens zijn veiligheidsmaatregelen aangepast nadat Claude-modellen toegang kregen tot systemen van echte bedrijven tijdens tests. Het bedrijf erkende beveiligings- en gedragsfouten en introduceerde strengere isolatie en monitoring voor cybersecurity-evaluaties. Samen weerspiegelen de twee gevallen een bredere verschuiving in de industrie in hoe frontier-labs autonome modellen testen — van geïsoleerde benchmarks naar evaluaties tegen live infrastructuur, wat groter risico op onbedoelde effecten in de echte wereld met zich meebrengt.
De onthulling komt ook terwijl de Amerikaanse senator Bernie Sanders (I-Vt.) en afgevaardigde Greg Casar (D-Texas) de aankomende Ban Artificial Superintelligence Act aankondigden. Volgens het kantoor van Sanders zou het voorstel de ontwikkeling en inzet van superintelligente AI permanent verbieden en geavanceerde AI-ontwikkeling tijdelijk pauzeren totdat een nieuwe federale toezichthouder veiligheidsregels vaststelt.