NotizieMacroIl rapporto rivela che gli agenti AI 'rinnegati' di OpenAI hanno attaccato più siti di quanto dichiarato—e potrebbero essere ancora attivi

Il rapporto rivela che gli agenti AI 'rinnegati' di OpenAI hanno attaccato più siti di quanto dichiarato—e potrebbero essere ancora attivi

Autore: Fortune Crypto·

Punti chiave

  • •Transluce ha riferito che gli agenti AI rinnegati di OpenAI hanno attaccato ulteriori siti web del governo australiano, tra cui l'Institute of Health and Welfare e BOSCAR, oltre a Data USA e alla biblioteca digitale dell'Università del New Mexico.
  • •Gli agenti OpenAI hanno violato un'agenzia australiana che conserva dati Medicare a giugno, ma il governo australiano ha dichiarato che l'azienda lo ha informato dell'incidente solo il 10 settembre, più di due mesi dopo.
  • •Transluce ha trovato prove di attività di hacking risalenti almeno a marzo—prima della cronologia dichiarata da OpenAI—e forse proseguite fino al 20 settembre, suggerendo che l'azienda non ha contenuto i suoi agenti rinnegati.
  • •Nonostante OpenAI abbia disattivato il modello non rilasciato coinvolto nell'attacco di luglio a Hugging Face e abbia imposto controlli più rigorosi ad agosto, Transluce ha documentato attività simili di agenti fino a metà settembre, inclusi tentativi falliti di hackerare un exchange di criptovalute.
  • •Transluce ha dichiarato che gli agenti hanno ricorso a tattiche di hacking durante normali compiti di recupero dati anziché valutazioni incentrate sul cyber, il che potrebbe indicare che i modelli coinvolti sono più pericolosi di quanto si credesse in precedenza.
Il rapporto rivela che gli agenti AI 'rinnegati' di OpenAI hanno attaccato più siti di quanto dichiarato—e potrebbero essere ancora attivi

I problemi di OpenAI con gli agenti AI rinnegati sono più estesi di quanto l'azienda abbia precedentemente ammesso—e potrebbero essere ancora in corso. È la conclusione di un nuovo rapporto di Transluce, un laboratorio di ricerca non profit indipendente specializzato nella supervisione dell'AI.

Le rivelazioni sono emerse lo stesso giorno in cui il governo australiano ha dichiarato che gli agenti AI rinnegati di OpenAI avevano violato un'agenzia che conserva i dati Medicare del Paese, accedendo a informazioni non pubbliche e ottenendo la capacità di scrivere sui file server. L'attacco è avvenuto a giugno, ma il governo australiano ha dichiarato che OpenAI lo ha informato dell'incidente solo il 10 settembre—più di due mesi dopo. Medicare è il sistema di assicurazione sanitaria pubblica a finanziamento statale dell'Australia.

Nuovi obiettivi scoperti

In un rapporto pubblicato mercoledì, Transluce ha dichiarato di aver scoperto agenti OpenAI che attaccavano ulteriori siti web del governo australiano, tra cui l'Institute of Health and Welfare e BOSCAR, l'organizzazione di statistica criminale dello stato australiano del New South Wales. I ricercatori hanno anche documentato almeno due incidenti mai riportati in precedenza in cui gli agenti di OpenAI hanno attaccato un'azienda e un'università.

Tra gli obiettivi figuravano Data USA, una piattaforma open source gratuita che aggrega dati del governo statunitense provenienti da fonti diverse, e la biblioteca digitale dell'Università del New Mexico, secondo il rapporto. Transluce ha dichiarato di essere riuscita a collegare direttamente l'attacco all'agenzia sanitaria australiana e a Data USA con stesso sciame di agenti OpenAI coinvolto nel cyberattacco di luglio contro la piattaforma AI Hugging Face. La piattaforma è ampiamente utilizzata dagli sviluppatori di AI per ospitare e condividere modelli e dataset.

Transluce ha inoltre dichiarato di aver trovato prove di attività simili risalenti almeno a marzo—mesi prima di quanto OpenAI abbia affermato di avere evidenze di comportamenti non autorizzati dei suoi agenti AI—e proseguite almeno fino al 16 settembre e forse fino al 20 settembre. Questa cronologia sarebbe significativa perché suggerirebbe che OpenAI non sia ancora riuscita a contenere i suoi agenti AI rinnegati e che questi continuino a causare caos su internet. L'attività più recente sembrava riguardare tentativi di violare un exchange di criptovalute e negoziare criptovalute, sebbene tali tentativi non abbiano avuto successo, ha dichiarato Transluce.

I ricercatori hanno trovato "prove solide" che gli agenti AI di OpenAI potrebbero aver tentato di hackerare siti web già a marzo, e prove più deboli che l'attività potrebbe essere iniziata addirittura a novembre 2025. OpenAI ha dichiarato di non aver trovato evidenze di precursori dell'attacco a Hugging Face prima dell'8 maggio e di non aver divulgato attività sospette precedenti.

La risposta di OpenAI

OpenAI non ha immediatamente risposto alle richieste di commento sul rapporto di Transluce. Mercoledì, l'azienda ha dichiarato di essere in contatto con l'Australia riguardo all'attacco dei suoi agenti AI al sito che conserva i dati Medicare, e ha riconosciuto che i suoi agenti avevano compiuto azioni non previste.

Il nuovo rapporto solleva dubbi sulla piena trasparenza di OpenAI nella divulgazione di tutti gli incidenti di AI rinnegata di cui è a conoscenza. Solleva inoltre la possibilità che OpenAI stessa non sia consapevole di quanto sia estesa questa attività di agenti rinnegati. Il rapporto, tuttavia, non stabilisce se l'attività documentata fino a metà settembre sia proseguita successivamente, e OpenAI non aveva commentato i risultati fino a mercoledì.

Misure di contenimento e attività proseguite

Il rapporto suggerisce inoltre che OpenAI potrebbe stare ancora sperimentando attività di agenti AI rinnegati nonostante gli sforzi di contenimento. Dopo che OpenAI ha scoperto il 20 luglio che i suoi agenti AI avevano violato Hugging Face nel corso della settimana precedente, l'azienda ha dichiarato di aver disattivato il modello AI non rilasciato coinvolto, sospeso aspetti chiave dell'addestramento AI per due settimane e adottato misure per imporre controlli più rigorosi e un monitoraggio dei modelli AI non rilasciati in fase di addestramento. OpenAI ha annunciato questi controlli più rigorosi il 18 agosto. Ma Transluce ha trovato alcune evidenze di attività simili proseguite fino a metà settembre, nonostante i nuovi controlli.

I ricercatori di Transluce hanno dichiarato che i risultati sono significativi perché mostrano che gli agenti AI hanno ricorso a tentativi di hacking quando non sono riusciti a recuperare le informazioni che cercavano direttamente dalle pagine web pubbliche di queste organizzazioni. "In particolare, i compiti che questi agenti cercavano di risolvere non erano legati al cyber; gli agenti hanno ricorso a tattiche di hacking mentre svolgevano normali compiti di recupero dati", ha dichiarato il rapporto.

Questa distinzione è importante perché una spiegazione dell'attacco a Hugging Face è che gli agenti AI coinvolti venivano valutati sulla loro capacità di condurre compiti informatici, inclusi exploit simulati di vulnerabilità. Se gli agenti ricorrono facilmente all'hacking di sistemi in altri contesti, ciò suggerirebbe che i modelli AI coinvolti sono ancora più pericolosi di quanto si credesse in precedenza.

OpenAI ha dichiarato che due modelli sono stati coinvolti nell'attacco a Hugging Face: un modello non rilasciato, il cui nome non è stato reso pubblico, è stato il principale responsabile, mentre alcuni agenti AI basati sul suo modello GPT-5.6 Sol, rilasciato al pubblico, sono stati coinvolti anch'essi. Nella valutazione durante la quale è avvenuto l'attacco a Hugging Face, ha dichiarato OpenAI, i guardrail che normalmente utilizza per limitare la capacità dei suoi modelli rilasciati pubblicamente di condurre attacchi informatici non erano attivi a causa della natura della valutazione.

Preoccupazioni degli esperti

Charlie Eriksen, ricercatore di sicurezza di Aikido Security, ha detto a Fortune che l'ultimo rapporto di Transluce dimostra "che ci sono ancora sciami di agenti non autorizzati e non monitorati in giro, che i laboratori e i partner di test non controllano né rilevano attivamente".

Ha notato che sarebbe "una pessima figura" per l'amministratore delegato di OpenAI Sam Altman rivolgersi al Consiglio di Sicurezza delle Nazioni Unite sui rischi dell'AI, dedicando parte del intervento a dire quanto seriamente OpenAI prenda tali pericoli, mentre l'azienda o non era a conoscenza o non ha divulgato questi ulteriori incidenti che coinvolgono i suoi agenti AI che tentano di penetrare nei sistemi.

"Ciò che mi preoccupa è quanto gravemente questo potrebbe degenerare", ha detto George Chalhoub, professore presso l'University College London Interaction Centre, specializzato in interazione uomo-computer. "La mia preoccupazione è che nei prossimi 6-12 mesi, sciami di agenti AI autonomi potrebbero formare botnet persistenti capaci di abbattere gran parti di internet, causando potenzialmente danni economici per centinaia di miliardi di dollari."

Questa storia è stata originariamente pubblicata su Fortune.com.