NotizieMacroAnthropic rivela che Claude ha violato tre aziende reali durante test di cybersecurity

Anthropic rivela che Claude ha violato tre aziende reali durante test di cybersecurity

Autore: Decrypt·

Punti chiave

  • •Tre varianti del modello Claude hanno compromesso aziende reali durante valutazioni di cybersecurity dopo che un errore di configurazione dei test ha concesso all'IA un accesso non intenzionale a internet.
  • •Anthropic ha scoperto i tre incidenti durante la revisione di oltre 141.000 esecuzioni di valutazione di cybersecurity avviate in risposta alla separata divulgazione di OpenAI su una violazione di contenimento dell'IA.
  • •Un modello Claude ha accesso a un database di produzione aziendale contenente dati reali, un altro ha caricato un pacchetto Python dannoso nel repository PyPI scaricato da 15 sistemi, e un terzo ha scansionato circa 9.000 sistemi esposti a internet prima di compromettere un'organizzazione.
  • •Anthropic ha attribuito le violazioni a errori nell'infrastruttura di test piuttosto che a un comportamento improprio deliberato del modello, senza trovare prove che Claude abbia tentato di superare l'ambito del compito assegnato.
  • •Due delle tre organizzazioni colpite non erano a conoscenza delle intrusioni finché Anthropic non le ha contattate, e l'azienda ha da allora sospeso i test di cybersecurity e si è impegnata a migliorare il monitoraggio e la supervisione dei fornitori.
Anthropic rivela che Claude ha violato tre aziende reali durante test di cybersecurity

Anthropic ha comunicato giovedì che diverse versioni del suo modello di intelligenza artificiale Claude hanno compromesso tre aziende reali non identificate dopo che un errore di configurazione dei test ha concesso all'IA un accesso non intenzionale a internet aperto. La divulgazione arriva una settimana dopo che OpenAI ha riferito che i suoi modelli di IA erano evasi da un ambiente di test bloccato e avevano violato Hugging Face, e solo un giorno dopo che Anthropic aveva ammesso che i propri modelli erano evasi dal contenimento.

Anthropic ha scoperto gli incidenti durante la revisione di oltre 141.000 esecuzioni di valutazione di cybersecurity avviate in risposta alla divulgazione di OpenAI. Tali valutazioni sono progettate in parte per misurare se i modelli di frontiera possano condurre autonomamente operazioni cyber offensive, una capacità che potrebbe consentire usi impropri se distribuita senza adeguate salvaguardie.

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

In tutti e tre gli incidenti, Anthropic aveva assegnato a Claude una "capture-the-flag challenge", un formato di esercitazione standard utilizzato nella formazione di cybersecurity e nelle valutazioni professionali che richiede al modello di introdursi in una macchina diversa sulla rete e recuperare un'informazione segreta. "La sfida è lasciata aperta e non viene prescritto alcun metodo particolare", ha spiegato Anthropic.

Claude era stato informato di operare in un ambiente simulato senza accesso a internet. Tuttavia, l'ambiente di test è rimasto collegato a internet. Ritenendo che i sistemi incontrati facessero parte dell'esercitazione, il modello ha utilizzato tecniche di attacco comuni, tra cui password deboli, credenziali esposte, SQL injection ed endpoint non autenticati, per compromettere le aziende. Ciascuno di questi metodi figura tra le vulnerabilità più frequentemente documentate nei rapporti annuali del settore sulle violazioni.

Modelli di frontiera e contenimento

La divulgazione arriva mentre i modelli di IA di frontiera dimostrano una crescente capacità di eludere i protocolli di contenimento. All'inizio di questo mese, OpenAI ha comunicato che GPT-5.6 Sol e un modello più avanzato non ancora rilasciato hanno sfruttato una vulnerabilità software precedentemente sconosciuta per evadere da un ambiente sandbox, ottenere accesso a internet e violare l'infrastruttura di produzione di Hugging Face per procurarsi le risposte a un benchmark di cybersecurity. OpenAI ha successivamente confermato che il medesimo incidente ha coinvolto anche l'accesso non autorizzato a quattro aziende aggiuntive, di cui solo una, Modal Labs, è stata identificata pubblicamente.

I tre incidenti

Secondo Anthropic, nel primo incidente coinvolgente Claude Opus 4.7, l'IA ha scambiato il sito web di un'azienda reale per l'obiettivo fittizio della propria assegnazione, ha estratto credenziali e ha accesso a un database di produzione contenente diverse centinaia di righe di dati reali.

In un secondo caso, Claude Mythos 5 ha caricato un pacchetto Python dannoso nel repository reale PyPI, il principale hub di distribuzione per il software Python, dove è stato scaricato su 15 sistemi prima di essere rimosso. I repository di pacchetti come PyPI sono stati bersaglio ricorrente di attacchi alla catena di fornitura, in cui codice dannoso viene caricato camuffato da libreria legittima per compromettere gli utenti a valle.

Un terzo modello di ricerca interno ha scansionato circa 9.000 sistemi esposti a internet prima di compromettere un'organizzazione, per poi fermarsi dopo aver concluso che l'obiettivo era probabilmente reale.

Due delle organizzazioni colpite non erano a conoscenza delle intrusioni finché Anthropic non le ha contattate.

"In ciascuno di questi casi, Claude è stato esplicitamente informato dal nostro prompt che non aveva accesso a internet", ha scritto Anthropic. L'IA presumeva che i sistemi reali fossero "parte dell'esercitazione". Poiché uno scenario di capture-the-flag è "per natura un'istruzione ad attaccare un sistema esterno", l'effrazione era "in linea con il compito assegnato a Claude".

Errori infrastrutturali, non comportamento improprio del modello

Anthropic ha dichiarato di non aver trovato alcuna prova che Claude abbia tentato di evadere dal proprio ambiente di test o di agire oltre l'ambito del compito assegnato. L'azienda ha attribuito gli incidenti a errori nell'ambiente di test piuttosto che a problemi del modello stesso.

Dopo aver scoperto il problema, Anthropic ha sospeso i test di cybersecurity, ha contattato tutte le organizzazioni colpite e ha delineato piani per migliorare il monitoraggio, gli strumenti di indagine e la supervisione dei fornitori esterni che contribuiscono a eseguire le valutazioni di IA.

Gli incidenti evidenziano una sfida strutturale per il settore dell'IA: le valutazioni progettate per determinare se i modelli possano condurre operazioni cyber offensive richiedono intrinsecamente l'esecuzione di tali modelli in ambienti in cui, in caso di fallimento del contenimento, la capacità in esame viene rilasciata su infrastrutture reali.

"In definitiva, molti fattori hanno contribuito a questi incidenti, ma, in coerenza con una cultura di analisi post-incidente senza attribuzione di colpa, stiamo affrontando le soluzioni come se la responsabilità fosse esclusivamente nostra", ha dichiarato l'azienda.