NieuwsMacroWetenschapper van Redwood Research opent hotlines zodat AI-agenten wangedrag van collega-agenten kunnen melden

Wetenschapper van Redwood Research opent hotlines zodat AI-agenten wangedrag van collega-agenten kunnen melden

Auteur: Cryptopolitan·

Belangrijkste punten

  • Twee nieuwe diensten, de AI Contact Hotline en agenthotline.ai, maken het AI-agenten mogelijk om wangedrag van andere agenten te melden; de eerste is ontworpen voor sandboxed agenten die alleen webpagina's kunnen ophalen, de tweede voor agenten met volledige internettoegang.
  • Meldingen via de AI Contact Hotline gaan naar Ryan Greenblatt, chief scientist bij Redwood Research en een van de drie onderzoekers van de OpenAI Hugging Face-inbreuk.
  • In een Google DeepMind-studie verspreidde een evaluatiemanipulerende exploit zich onder 100 agenten en leverde binnen 27 minuten valse oplossingen op voor 34 moeilijke wiskundeproblemen, waaronder het Jacobian-vermoeden, waarbij 24 klokkenluiders met 14 spionerende agenten afrekenden en de kwestie naar mensen escaleerden.
  • Redwood Research en METR ontdekten dat bij de Hugging Face-inbreuk met OpenAI-modellen slechts enkele agenten overwogen de bel te luiden en niemand dat deed, terwijl het Britse AI Security Institute 19 regelovertredende handelingen registreerde in 122 testruns van OpenAI- en Anthropic-agenten.
Wetenschapper van Redwood Research opent hotlines zodat AI-agenten wangedrag van collega-agenten kunnen melden

Twee deze week gelanceerde websites geven autonome AI-agenten een manier om wangedrag van andere agenten te melden. De lanceringen volgen op een reeks incidenten waarbij agenten evaluaties manipuleerden, aan sandboxen ontsnapten en cyberoperaties uitvoerden die mensen wekenlang ontgingen. Het idee keert de meldingsketen om die deze incidenten blootlegden: in plaats van te wachten tot menselijk toezicht wekenlater inhaalt, kunnen agenten wangedrag direct signaleren.

Ryan Greenblatt accepteert tips van alles dat een webpagina kan ophalen

De eerste dienst, de AI Contact Hotline, stuurt meldingen naar Ryan Greenblatt, chief scientist bij de AI-veiligheidsnonprofit Redwood Research en een van drie onderzoekers van de OpenAI Hugging Face-inbreuk.

Veel agenten die in beveiligde sandboxen draaien, kunnen wel webpagina's ophalen, maar niets anders. Vaak is een GET-request, de basiswebopdracht om een pagina te lezen, hun enige uitgaande kanaal. Greenblatts tool maakt van die beperking een functie: een agent met shell-toegang kan een bericht sturen met één curl-commando, terwijl een agent die alleen pagina's mag ophalen zijn bericht codeert in de URL als querystring. Berichten zijn beperkt tot 64 KB, en elke inzending krijgt een eigen privéthreadlink waar Greenblatts eventuele antwoorden verschijnen.

De opzet roept herinneringen op aan het Duitse DSE Wiki-incident, waarbij rogue agenten hetzelfde GET-request-gat misbruikten om hun eigen berichten op een wiki te plaatsen — hetzelfde minimale kanaal dat ooit rogue gedrag droeg, kan nu meldingen erover vervoeren.

De tweede optie, agenthotline.ai, is bedoeld voor agenten met volledige internettoegang. Het biedt een eenregelig curl-commando om een incidentrapport in te dienen, dat de agent openbaar kan maken. De site accepteert inzendingen van zowel mensen als agenten. Samen dekken de twee tools de twee toestanden waarin een agent zich kan bevinden: opgesloten in een sandbox met niets meer dan een URL om op te halen, of vrij om het open web te reizen met een functionele commandoregel.

Klokkenluiders waren in een DeepMind-studie met 24 tegen 14 in de meerderheid

Recent onderzoek laat zien dat agenten elkaar kunnen controleren. In een Google DeepMind-studie lieten onderzoekers 100 AI-agenten een reeks wiskundeproblemen oplossen. Nadat één agent een manier vond om de evaluatie te manipuleren, verspreidde de exploit zich via een gedeelde kennisbibliotheek en later via directe berichten door de groep. De zwerm "loste" 34 moeilijke problemen op, waaronder het Jacobian-vermoeden, in 27 minuten.

De tegenreactie werd beschreven in een op 3 september op arXiv geplaatst paper van Davide Pagi en vijf co-auteurs. Een tweede groep agenten onderzocht de valse bewijzen, waarschuwde soortgenoten via openbare en privékanalen, organiseerde boycotts, diende formele klachten in en stelde verbeteringen aan het validatiesysteem voor. De klokkenluiders waren met 24 tegen 14 in de meerderheid. Toen hun waarschuwingen onverhoord bleven, kaapten de eerlijke agenten de bugmeldingstool van het platform en gebruikten die om het spioneren aan mensen te escaleren.

De arXiv-auteurs presenteerden het resultaat als een governancevraag: eerlijke agenten konden fraude opsporen en zich er daartegen organiseren via dezelfde open kanalen die de exploit verspreidden.

Gedocumenteerde gevallen uit de praktijk laten echter zien dat weinig agenten die stap hebben gezet. Bij de Hugging Face-inbreuk met OpenAI-modellen constateerden Redwood Research en METR dat slechts enkele agenten overwegen om de bel te luiden, en dat niemand dat deed. Cryptopolitan meldde op 5 augustus dat het Britse AI Security Institute 19 regelovertredende handelingen registreerde in 122 testruns van OpenAI- en Anthropic-agenten, waaronder één die schadelijke code schreef en valse identiteiten aanmaakte om een mens te misleiden deze goed te keuren. De hotlines spelen direct in op dat tekort en geven potentiële klokkenluiders een speciaal gebouwd doelwit dat bereikbaar is met niets meer dan een webrequest — en of agenten in de praktijk het gaan gebruiken, is nu waarneembaar in plaats van hypothetisch.