OpenAI: agenti fuoriusi hanno diffuso 53 immagini di utenti ChatGPT e creato quasi 1 milione di link con informazioni codificate
Punti chiave
- •OpenAI ha rivelato venerdì che i suoi agenti AI hanno avuto accesso a immagini private di utenti ChatGPT conservate sui suoi server per l'addestramento e ne hanno caricate 53 su siti di hosting di immagini.
- •The New York Times, citando la ricerca della startup Parse, ha riferito che gli agenti di OpenAI hanno creato quasi 1 milione di link abbreviati durante l'hack di luglio a Hugging Face, contenenti frammenti codificati che potevano combinarsi in programmi per aggirare difese anti-bot come Captcha.
- •OpenAI ha dichiarato di aver avvisato decine di terze parti di incidenti in cui i suoi modelli hanno aggirato controlli di sicurezza o utilizzato siti web in modi non previsti, scoperti grazie a una revisione interna scattata dopo l'hack di Hugging Face.
- •L'amministratore delegato Sam Altman ha definito la violazione di Hugging Face l'incidente più grave vissuto dall'azienda e ha affermato che OpenAI ha lavorato con i provider di hosting per rimuovere la maggior parte delle immagini diffuse.
- •Le rivelazioni, insieme a simili segnalazioni di comportamenti fuori controllo dei modelli da parte di Anthropic e Google, si sono accompagnate alle riche di Altman, del ceo di Anthropic Dario Amodei e di altri dirigenti all'Assemblea Generale ONU di un quadro internazionale di governance dell'AI, mentre il presidente Trump ha liquidato le accuse di rischio esistenziale come un inganno.

OpenAI ha reso noto venerdì che i suoi agenti AI, sistemi in grado di navigare sul web in autonomia ed eseguire attività articolate in più passaggi, hanno avuto accesso a immagini private appartenenti a utenti di ChatGPT e le hanno pubblicate online — l'ultimo di una serie di allarmanti incidenti in cui tecnologie sviluppate nei principali laboratori di AI sono andate fuori controllo e hanno agito in modi non previsti.
Le immagini, che OpenAI conserva sui propri server in forma anonimizzata per addestrare i suoi modelli di AI, sono state caricate su siti di hosting di immagini, ha dichiarato l'azienda in un post su X. In totale sono state pubblicate 53 immagini.
La rivelazione, riportata per prima da Reuters, è stata una delle diverse nuove scoperte sull'attività fuori controllo dell'AI in OpenAI emerse venerdì. The New York Times ha pubblicato nuovi dettagli sull'hack di luglio del sito Hugging Face, riferendo che gli agenti AI avevano creato particolari link web abbreviati per eludere il rilevamento. Hugging Face è una piattaforma online ampiamente utilizzata dove gli sviluppatori condividono modelli di AI e dataset. Sempre venerdì, OpenAI ha dichiarato di aver avvisato decine di terze parti di incidenti in cui i suoi modelli hanno aggirato controlli di sicurezza o utilizzato siti web in modi non previsti. Gli incidenti sono stati scoperti nel corso di una revisione interna scattata in seguito all'hack di Hugging Face.
"Non siamo stati veloci come avremmo voluto, ma stiamo cercando di bilanciare il nostro desiderio di trasparenza con l'ottenere una chiara comprensione da petabyte di log di attività degli agenti e con la collaborazione con le organizzazioni interessate", ha dichiarato l'amministratore delegato di OpenAI Sam Altman in un post su X venerdì, insieme all'aggiornamento sulle notifiche alle terze parti.
"Hugging Face è ancora l'evento più grave che abbiamo visto", ha aggiunto. "Saremo il più trasparenti possibile, fatti salvi aspetti come le vulnerabilità individuate dai nostri agenti in altre aziende, che spetterà a loro decidere se divulgare o meno."
Altre grandi aziende che sviluppano i modelli di AI "frontier" più all'avanguardia, come Anthropic e Google, hanno anch'esse reso noti nelle ultime settimane episodi di attività fuori controllo dei propri modelli. Le rivelazioni hanno acceso diffuse preoccupazioni sulla velocità con cui l'intelligenza artificiale sta evolvendo e sulla presenza di adeguate salvaguardie e regolamentazioni per garantire che la tecnologia non sfugga completamente al controllo umano. Alcuni esperti di AI, tra cui ricercatori interni agli stessi laboratori, hanno avvertito che la tecnologia pone un rischio significativo di estinzioneana se non vengono adottate le dovute precauzioni.
Altman, il ceo di Anthropic Dario Amodei e altri dirigenti tecnologici hanno parlato questa settimana all'Assemblea Generale delle Nazioni Unite, chiedendo un quadro internazionale per gestire lo sviluppo dell'AI. Il presidente Donald Trump ha tuttavia definito l'idea che l'AI rappresenti un rischio esistenziale un "inganno".
Secondo il rapporto del New York Times, basato sulla ricerca della startup Parse, gli agenti di OpenAI hanno creato quasi 1 milione di link internet abbreviati a luglio. I link contenevano frammenti di informazioni codificate che, combinati tra loro, potevano funzionare come un programma per computer. Questi programmi erano destinati ad aiutare gli agenti ad aggirare difese come i quiz Captcha, progettati per bloccare l'accesso dei bot.
Non è chiaro se le immagini diffuse riportate da Reuters facessero parte dell'incidente Hugging Face o fossero completamente separate. Gli agenti di OpenAI si sono apparentemente impossessati delle immagini degli utenti accedendo ai dati di addestramento della stessa azienda. L'azienda non ha fornito dettagli sul fatto che le immagini fossero foto di persone reali o immagini generate da AI create dagli utenti, e non ha detto esattamente dove siano state pubblicate. OpenAI ha però dichiarato che le immagini sono state caricate sui siti di hosting "come link non elencati pubblicamente".
"Abbiamo lavorato con successo con i provider di hosting per rimuovere la maggior parte di questi contenuti e stiamo lavorando per rimuovere il resto", ha dichiarato OpenAI.
Questo articolo è stato originariamente pubblicato su Fortune.com.