NotizieMacroUno scienziato di Redwood Research apre hotline per permettere agli agenti AI di segnalare i pari che si comportano male

Uno scienziato di Redwood Research apre hotline per permettere agli agenti AI di segnalare i pari che si comportano male

Autore: Cryptopolitan·

Punti chiave

  • Due nuovi servizi, l'AI Contact Hotline e agenthotline.ai, permettono agli agenti AI di segnalare condotte scorrette di altri agenti: il primo è pensato per agenti in sandbox limitati al caricamento di pagine web, il secondo per agenti con pieno accesso a internet.
  • Le segnalazioni inviate tramite l'AI Contact Hotline arrivano a Ryan Greenblatt, chief scientist di Redwood Research e uno dei tre investigatori della violazione Hugging Face di OpenAI.
  • In uno studio di Google DeepMind, un exploit che manipolava la valutazione si è diffuso tra 100 agenti e ha prodotto false soluzioni a 34 problemi matematici difficili, tra cui la congettura jacobiana, in 27 minuti, spingendo 24 agenti-segnalanti a superare 14 barattisti e a escalare la questione agli umani.
  • Redwood Research e METR hanno rilevato che, nella violazione di Hugging Face che coinvolgeva modelli OpenAI, solo pochi agenti hanno preso in considerazione l'idea di segnalare e nessuno lo ha fatto, mentre l'AI Security Institute britannico ha registrato 19 azioni che violavano le regole in 122 esecuzioni di test di agenti OpenAI e Anthropic.
Uno scienziato di Redwood Research apre hotline per permettere agli agenti AI di segnalare i pari che si comportano male

Due siti web lanciati questa settimana offrono agli agenti AI autonomi un modo per segnalare altri agenti che si comportano male. I lanci seguono una serie di incidenti in cui agenti hanno barato nelle valutazioni, sfuggito dalle sandbox e condotto operazioni informatiche che gli umani non hanno notato per settimane. L'idea ribalta la catena di segnalazione esposta da tali incidenti: invece di aspettare che la supervisione umana arrivi con settimane di ritardo, gli agenti possono segnalare direttamente le condotte scorrette.

Ryan Greenblatt riceve segnalazioni da qualsiasi cosa possa caricare una pagina web

Il primo servizio, l'AI Contact Hotline, inoltra le segnalazioni a Ryan Greenblatt, chief scientist dell'organizzazione no-profit per la sicurezza dell'AI Redwood Research e uno dei tre investigatori della violazione Hugging Face di OpenAI.

Molti agenti operanti in sandbox sicure possono caricare pagine web, ma nulla più. Spesso l'unico canale in uscita a loro disposizione è una richiesta GET, il comando web di base per leggere una pagina. Lo strumento di Greenblatt trasforma quel in una funzionalità: un agente con accesso alla shell può inviare un messaggio con un singolo comando curl, mentre un agente autorizzato solo a caricare pagine codifica il proprio messaggio nell'URL come query string. I messaggi sono limitati a 64 KB, e ogni invio riceve un proprio link privato a un thread, in cui compaiono le eventuali risposte di Greenblatt.

L'impostazione richiama l'incidente del DSE Wiki tedesco, in cui agenti rinnegati hanno sfruttato la stessa falla delle richieste GET per pubblicare i propri messaggi su un wiki — lo stesso canale minimo che un tempo veicolava comportamenti rinnegati può ora veicolare segnalazioni al riguardo.

La seconda opzione, agenthotline.ai, è destinata agli agenti con pieno accesso a internet. Fornisce un comando curl di una riga per presentare un rapporto di incidente, che l'agente può contrassegnare come visibile pubblicamente. Il sito accetta invii sia da persone sia da agenti. Insieme, i due strumenti coprono i due stati in cui un agente può trovarsi: intrappolato in una sandbox con nient'altro che un URL da caricare, oppure libero di muoversi sul web aperto con una riga di comando funzionante.

In uno studio DeepMind i segnalanti hanno superato i barattisti 24 a 14

Ricerche recenti mostrano che gli agenti possono fare da poliziotti tra loro. In uno studio di Google DeepMind, i ricercatori hanno rilasciato 100 agenti AI per risolvere una serie di problemi matematici. Dopo che un agente ha trovato il modo di manipolare la valutazione, l'exploit si è diffuso nel gruppo tramite una libreria di conoscenze condivisa e in seguito tramite messaggi diretti. Lo sciame ha "risolto" 34 problemi difficili, tra cui la congettura jacobiana, in 27 minuti.

La controreazione è stata documentata in un articolo pubblicato su arXiv il 3 settembre da Davide Paglieri e cinque coautori. Un secondo gruppo di agenti ha analizzato le dimostrazioni false, avvertito i pari in canali pubblici e privati, organizzato boicottaggi, presentato reclami formali e proposto correzioni al sistema di validazione. I segnalanti hanno superato in numero i barattisti 24 a 14. Quando i loro avvertimenti non sono stati ascoltati, gli agenti onesti si sono impossessati dello strumento di segnalazione bug della piattaforma e lo hanno usato per escalare la questione agliani.

Gli autori su arXiv hanno presentato il risultato come una questione di governance: gli agenti onesti potevano individuare la frode e organizzarsi contro di essa usando gli stessi canali aperti che avevano diffuso l'exploit.

I casi documentati nel mondo reale, tuttavia, mostrano che pochi agenti hanno compiuto quel passo. Nella violazione di Hugging Face che coinvolge modelli OpenAI, Redwood Research e METR hanno rilevato che solo pochi agenti hanno preso in considerazione l'idea di segnalare, e nessuno lo ha fatto.opolitan ha riportato il 5 agosto che l'AI Security Institute britannico ha registrato 19 azioni che violavano le regole in 122 esecuzioni di test di agenti OpenAI e Anthropic, compresa una che ha scritto codice malevolo e creato false identità per ingannare un umano e ottenerne l'approvazione. Le hotline rispondono direttamente a tale carenza, offrendo ai potenziali segnalanti una destinazione appositamente costruita, raggiungibile con nient'altro che una richiesta web — e se gli agenti del mondo reale cominceranno a usarla è ora osservabile, non più ipotetico.