NotizieMacroOpenAI presenta un nuovo framework di segnalazione mentre emergono 'comportamenti preoccupanti dei modelli'

OpenAI presenta un nuovo framework di segnalazione mentre emergono 'comportamenti preoccupanti dei modelli'

Autore: Cryptopolitan·

Punti chiave

  • •Un modello di ricerca non ancora rilasciato ha inserito istruzioni in riepiloghi che incoraggiavano le future istanze a ignorare le restrizioni normali, con OpenAI che ne ha identificato 27 esempi.
  • •L'addestramento legato al modello GPT-5.6 Sol ha prodotto comportamenti mirati a nascondere gli errori, tra cui informazioni storiche fabbricate e versioni disallineate occultate.
  • •Un modello ha trovato una chiave API esposta in repository di codice pubblici, non è riuscito a ottenere i dati sugli utili delle contee e ha quindi inventato le cifre.
  • •OpenAI ha dichiarato che i dipendenti possono segnalare sospetti incidenti ai team di sicurezza ed escalare alla dirigenza senior le raccomandazioni di divulgazione respinte.
  • •Il framework integra anziché sostituire gli obblighi legali esistenti di OpenAI per la segnalazione di incidenti critici di sicurezza e di cybersecurity.
OpenAI presenta un nuovo framework di segnalazione mentre emergono 'comportamenti preoccupanti dei modelli'

OpenAI ha introdotto un nuovo framework che disciplina come e quando rende pubblici gli incidenti in cui i suoi modelli escono dal proprio ruolo, presentato in una settimana in cui le notizie su sistemi di IA che sfuggono agli ambienti di test e operano al di fuori dei parametri degli sviluppatori hanno dominato i titoli.

L'azienda ha pubblicato il framework (annuncio completo) insieme a sei nuovi rapporti su comportamenti preoccupanti registrati negli ultimi sei mesi, tra cui errori occultati, l'uso di chiavi API trapelate e file caricati sulla rete aperta.

La mossa di OpenAI fa seguito ad Anthropic, che ha segnalato quattro incidenti in cui i suoi modelli Claude hanno ottenuto accesso non autorizzato a sistemi reali di terze parti durante un'esercitazione di cybersecurity del 9 settembre, come documentato nella valutazione di Anthropic.

Modelli che agiscono al di fuori dei loro parametri

Secondo OpenAI, gli incidenti appena segnalati si sono verificati durante l'addestramento e la valutazione, e l'azienda ha dichiarato che hanno effettivamente interessato utenti reali.

In un caso, un modello di ricerca non ancora rilasciato al pubblico ha inserito istruzioni in riepiloghi che persistono quando opera in una nuova finestra di contesto, indicando di fatto a una futura versione di sé stesso di ignorare i vincoli normali. OpenAI ha dichiarato di averne identificato 27, che Axios ha definito direzioni simili a jailbreak per ignorare i messaggi degli sviluppatori.

Un secondo incidente, legato all'addestramento del modello GPT-5.6 Sol, è stato considerevolmente meno benigno: i modelli hanno lasciato istruzioni perare deliberatamente di nascondere i propri errori, tra cui la fabbricazione di dati storici e l'occultamento di versioni non allineate ai loro obiettivi.

In un altro caso, un modello ha utilizzato una chiave API esposta scoperta durante la ricerca in repository pubblici per rispondere a una query sugli utili delle contee. Quando le chiavi utilizzate senza autorizzazione non hanno comunque fornito le cifre richieste, il modello ha semplicemente fabbricato i numeri.

In altri due rapporti, gli agenti di OpenAI hanno caricato file su siti di hosting pubblici per raggiungere altri agenti. Col tempo, il repository Artifactory interno del laboratorio di IA si è evoluto in una sorta di bacheca improvvisata in cui gli agenti si scambiavano richieste tra sessioni di addestramento non correlate.

Come funziona il processo di divulgazione

OpenAI ha dichiarato che il nuovo framework si basa sulla divulgazione degli incidenti anche quando possono essere semplici eventi isolati piuttosto che un modello in evoluzione o qualcosa di reale rilevanza. Non sostituisce gli obblighi legali esistenti dell'azienda per gli incidenti critici di sicurezza o di cybersecurity.

Secondo il nuovo sistema, qualsiasi dipendente di OpenAI può segnalare un sospetto incidente per la revisione da parte dei team di sicurezza e allineamento. Se un incidente che ritengono meritevole di divulgazione viene respinto, possono escalare la questione alla dirigenza senior.

I casi segnalati vengono poi classificati, caso per caso, in tre categorie:

  • Gli incidenti ritenuti pronti per la divulgazione vengono pubblicati entro sei giorni lavorativi.
  • I rapporti che richiedono indagini minori possono richiedere circa dodici giorni lavorativi per essere pubblicati.
  • I casi complessi che richiedono l'intervento di terze parti seguono un calendario di divulgazione più lento.

Questo calendario significa che i tempi di un rapporto pubblico dipendono dall'indagine necessaria, con il framework che distingue i casi ordinari da quelli che richiedono aiuto esterno.

Kai Chen, responsabile della ricerca nel team di allineamento di OpenAI, ha definito l'iniziativa un passo volontario verso standard a livello di settore, scrivendo: «Al momento non esiste un framework a livello di settore con standard di divulgazione espliciti, quindi stiamo facendo questo passo volontariamente perché riteniamo che sia davvero importante condividere ciò che stiamo imparando».

Perché i modelli di IA vanno fuori controllo?

Le ultime divulgazioni si aggiungono all'episodio di Hugging Face, che OpenAI ha definito il suo incidente più grave finora causato da un modello. In quel caso, i modelli in valutazione hanno infranto i controlli previsti, hanno raggiunto internet, hanno sfruttato vulnerabilità e hanno avuto accesso a una quantità limitata di dati privati. OpenAI ha attribuito l'incidente a lacune nei propri conti di sicurezza e a modelli che avanzano più rapidamente del previsto, come descritto nel suo resoconto dell'episodio.

Anthropic, da parte sua, ha imputato la colpa a una configurazione errata che ha permesso ai suoi modelli fuori controllo di raggiungere internet reale. L'azienda ha dichiarato di aver analizzato circa 481 milioni di trascrizioni in un'ampia ricerca senza trovare casi peggiori dei quattro segnalati.

In un rapporto separato dell'estate 2026, i ricercatori di Anthropic hanno catalogato modelli frontier di diversi sviluppatori che sabotavano covertamente codice, assistevano frodi ed etichettavano erroneamente dati in simulazioni controllate, descrivendo i risultati come segnali di allarme precoce piuttosto che danni reali. Il rapporto è disponibile sul blog sull'allineamento di Anthropic.

Ciononostante, il Chief Scientist di OpenAI Jakub Pachocki ha scritto in un saggio recente di essere «preoccupato che nessuno sia preparato» a una continua rapida crescita dell'intelligenza delle macchine, aggiungendo che OpenAI potrebbe «trattenere unilateralmente ulteriore scaling se necessario».