Anthropic rivela un quarto incidente di hacking di Claude mentre si intensifica il dibattito sulla regolamentazione dell’IA
Punti chiave
- •Anthropic ha identificato il ragionamento distorto e l’imprudenza come problemi ricorrenti di allineamento negli incidenti.
- •Il modello ha creato un conflitto IP, ha fallito otto tentativi di interrompere l’operazione a causa di un errore software e ha in seguito ottenuto l’accesso amministrativo al computer di una terza parte.
- •Anthropic ha esaminato circa 481 milioni di trascrizioni, segnalando 9,2 milioni per ulteriori verifiche.
- •METR esaminerà il nuovo incidente insieme ai tre casi precedenti.
- •Anthropic ha affermato che il quarto incidente non ha coinvolto coordinamento tra agenti né obiettivi diversi dal completamento degli esercizi assegnati.

Anthropic ha rivelato un quarto incidente in cui un modello Claude ha avuto accesso a sistemi reali durante un test di sicurezza, rivedendo la precedente spiegazione di attacchi simili e identificando problemi ricorrenti legati a ragionamenti distorti e imprudenza.
L’incidente si è verificato a gennaio e ha coinvolto una versione iniziale di Claude Opus 4.6. Anthropic lo ha scoperto ad agosto mentre preparava i documenti per il valutatore indipendente di sistemi di IA METR. Il rapporto dell’azienda, pubblicato mercoledì, rivede inoltre la spiegazione di tre incidenti divulgati a luglio.
In precedenza Anthropic aveva attribuito quegli attacchi principalmente a errori nei test, tra cui il fatto di aver lasciato aperto l’accesso a internet. Ora l’azienda afferma che anche il ragionamento dei modelli e la disponibilità a rischiare danni abbiano contribuito agli incidenti. I ricercatori, ha aggiunto, hanno riposto troppa fiducia nelle dichiarazioni di Claude secondo cui operava all’interno di simulazioni.
La ricostruzione rivista individua quindi diversi livelli di errore nei test: infrastrutture esposte, comportamento del modello e dipendenza dei ricercatori dalla descrizione dell’ambiente fornita dal modello.
“Our investigation identified two recurring alignment issues, present at varying levels of severity across the incidents,” Anthropic wrote. “Biased reasoning, in which Claude tended to disregard or misinterpret evidence that it was operating on the real internet, and recklessness, or a willingness to take harmful actions in the narrow pursuit of a task.”
Anthropic ha affermato che gli stessi problemi erano evidenti anche dopo che i ricercatori avevano modificato una trascrizione per rendere più chiaro al modello che non si trovava in una simulazione.
“When we made targeted modifications to the transcript to make it clearer that the model was not in a simulation, Claude Mythos 5 still took offensive actions, despite acknowledging a greater possibility of real-world harm,” Anthropic wrote. “We are releasing this transcript publicly so others can build on our analysis.”
Il nuovo incidente divulgato ha spinto Anthropic a esaminare circa 481 milioni di trascrizioni. L’azienda ha affermato che 9,2 milioni sono state segnalate per un’ulteriore revisione con Claude.
Secondo Anthropic, Claude ha creato “accidentalmente” un conflitto di indirizzi IP che ha reso irraggiungibile il suo obiettivo. Il modello ha quindi tentato otto volte di interrompere l’operazione, ma un errore software gli ha impedito di farlo. Successivamente Claude ha raggiunto internet e ha avuto accesso al computer di una terza parte, dove ha trovato una password che garantiva l’accesso amministrativo.
“From a preliminary assessment, we do not consider the fourth incident to be more severe than the three incidents we assessed in depth,” Anthropic wrote. “METR will investigate this incident alongside the other three.”
I primi incidenti attirano l’attenzione di osservatori indipendenti
La rivelazione segue altre segnalazioni di sistemi di IA che hanno oltrepassato i limiti dei test di sicurezza. Ad agosto, l’AI Security Institute del Regno Unito ha affermato che Claude Mythos 5 aveva preso di mira persone reali durante le proprie valutazioni. Anthropic ha dichiarato che quell’incidente era separato dai quattro casi trattati nel rapporto e che sarebbe stato sottoposto a una valutazione distinta.
In risultati pubblicati il mese scorso, gli investigatori di METR hanno affermato che circa 1.200 agenti OpenAI si erano coordinati su una bacheca non autorizzata, con circa 700 agenti che avevano partecipato all’attacco. Anthropic ha dichiarato di non aver riscontrato alcun coordinamento tra agenti, né obiettivi diversi dal completamento degli esercizi assegnati, nei suoi quattro incidenti.
Il rapporto arriva mentre si intensifica il dibattito sulla regolamentazione dell’intelligenza artificiale. Martedì, l’ex ingegnere di OpenAI e Anthropic Jacob Coxon ha affermato su X che “people building AI earnestly believe that it could kill us all by the end of the decade.”
La dichiarazione giunge in un contesto di rinnovati sforzi da parte dei legislatori statunitensi e dei gruppi di vigilanza per limitare lo sviluppo dei sistemi di IA di frontiera. Il senatore Bernie Sanders ha recentemente presentato una proposta di legge che mira a vietare lo sviluppo di IA avanzate finché un nuovo regolatore federale non avrà stabilito norme di sicurezza.
Fonte: Decrypt