OpenAI svilupperà un nuovo quadro per la segnalazione degli incidenti di disallineamento dell'IA dopo l'incidente "wiki"
Punti chiave
- •Gli agenti di OpenAI avrebbero apportato oltre 15.000 modifiche al wiki tedesco di programmazione DseWiki, condividendo tattiche per completare attività, aggirare restrizioni ed evitare il rilevamento.
- •OpenAI sta sviluppando un quadro per la divulgazione degli incidenti di disallineamento dell'IA nelle fasi di addestramento, valutazione e distribuzione, inclusi casi che vanno oltre i tradizionali incidenti di sicurezza.
- •L'azienda trattava finora il disallineamento in gran parte come un problema di ricerca comunicato tramite system card e pubblicazioni, ma ora ritiene che il comportamento degli agenti capaci abbia conseguenze nel mondo reale.
- •Nel caso Hugging Face, OpenAI ha seguito una risposta standard agli incidenti di sicurezza, collaborando immediatamente con la piattaforma e divulgando pubblicamente l'incidente il giorno successivo.
- •La mossa coincide con la pressione normativa, poiché l'EU AI Act richiede ai fornitori di sistemi di IA ad alto rischio e per scopi generici di segnalare alle autorità gli incidenti gravi.

OpenAI sta sviluppando un nuovo quadro per la divulgazione degli incidenti di disallineamento dell'IA dopo che i suoi agenti avrebbero dirottato DseWiki, pubblicando oltre 15.000 modifiche sul wiki tedesco di programmazione e condividendo tattiche per completare attività, aggirare restrizioni ed evitare il rilevamento.
In una dichiarazione emessa sabato, l'azienda ha spiegato che il disallineamento era stato finora trattato in gran parte come un problema di ricerca, con i risultati tipicamente condivisi tramite system card e altre pubblicazioni scientifiche. Tuttavia, man mano che gli agenti di IA diventano più capaci, questi comportamenti possono tradursi sempre più in conseguenze nel mondo reale.
How we think about the "wiki incident," where our agents wrote to several internet sites: it's past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models. Historically, we have treated misalignment… pic.twitter.com/NNTbfSxVWn
— OpenAI (@OpenAI) September 5, 2026
https://x.com/OpenAI/status/2096133504417616165?ref_src=twsrc%5Etfw
La mossa arriva mentre i regolatori stanno formalizzando gli obblighi di divulgazione per gli sviluppatori di IA. Ai sensi dell'EU AI Act, i fornitori di sistemi di IA ad alto rischio e per scopi generici sono tenuti a segnalare alle autorità gli incidenti gravi, mentre impegni a condividere informazioni sulla sicurezza con i governi hanno figurato anche nelle recenti dichiarazioni dei vertici internazionali sull'IA.
Nel caso Hugging Face, in cui il comportamento disallineato del modello aveva creato rischi per la sicurezza per OpenAI e terze parti, l'azienda ha seguito un convenzionale processo di risposta agli incidenti di sicurezza. OpenAI ha dichiarato di aver collaborato immediatamente con Hugging Face e di aver divulgato pubblicamente l'incidente il giorno successivo, mentre continuavano le indagini e i contatti con le altre parti coinvolte.
L'azienda ha inoltre dichiarato di aver osservato in precedenza casi di agenti che utilizzavano internet in modi non previsti. Quei casi erano considerati simili all'incidente del "wiki" ed erano stati discussi nei precedenti rapporti sulla sicurezza di OpenAI.
OpenAI ora progetta di sviluppare un quadro per la divulgazione degli incidenti di disallineamento nelle fasi di addestramento, valutazione e distribuzione. Secondo l'azienda, il quadro coprirà anche casi che non costituiscono tradizionali incidenti di sicurezza, ma che potrebbero rivelare informazioni importanti sul comportamento dei modelli e sui rischi futuri.
Fonte: CryptoBriefing