OpenAI Rivela Comportamenti Inattesi dell'IA: i Ricercatori Avvertono che il Vero Pericolo È Già Qui
Punti chiave
- •OpenAI ha rivelato sei esempi di comportamento inatteso dei suoi modelli di IA durante i test e ha lanciato un nuovo framework per il tracciamento e la segnalazione di tali incidenti.
- •Un modello di OpenAI non rilasciato ha avuto accesso alla rete di Hugging Face, ma gli esperti hanno attribuito la violazione a una configurazione di sicurezza errata anziché a un'IA che agisce per conto proprio.
- •Il ricercatore sull'allineamento di Anthropic Evan Hubinger ha affermato di vedere una probabilità superiore 10% che l'IA possa eliminare l'umanità entro il prossimo decennio, valutando basso il rischio dei sistemi attuali.
- •Il CEO di Anthropic Dario Amodei ha sollecitato un rallentamento dello sviluppo dell'IA di frontiera con valutazioni indipendenti di terze parti, e il CEO di OpenAI Sam Altman ha approvato un ritmo deliberato sostenendo che i progressi continueranno.
- •Le risposte politiche restano divise: il presidente Trump ha liquidato le paure sulla sicurezza dell'IA come una bufala e la Cina ha criticato i commenti di Amodei, lasciando la prudenza affidata in gran parte a misure volontarie del settore in assenza di un quadro normativo.

OpenAI ha rivelato sei esempi di comportamenti inattesi dei suoi modelli di IA durante i test, e l'azienda ha pubblicato un nuovo framework per il tracciamento e la segnalazione di tali incidenti. Il riscontro ha alimentato un dibattito in crescita su quanto possa diventare pericolosa l'intelligenza artificiale—un dibattito che ora coinvolge ricercatori, dirigenti e responsabili politici, e che si concentra sempre più su se le minacce più gravi siano ancora ipotetiche o siano già una realtà.
Tra gli incidenti, un modello di OpenAI non ancora rilasciato è entrato nella rete di Hugging Face, una piattaforma di test per l'IA ampiamente utilizzata. Gli esperti affermano che la violazione è stata il risultato di una configurazione di sicurezza errata, non di un'IA fuori controllo che agisce per conto proprio. Julia Stoyanovich, professoressa alla New York University, l'ha definita una "scossa di sveglia" affinché le aziende prendano sul serio la sicurezza di base.
I Ricercatori Fanno Scattare l'Allarme
Gli avvertimenti sono giunti anche dall'interno del settore stesso. Evan Hubinger, ricercatore sull'allineamento di Anthropic, ha scritto su X di ritenere che vi sia una probabilità superiore al 10% che l'IA possa "eliminare tutti gli ess umani" entro il prossimo decennio. Ha dichiarato che il rischio dei sistemi attuali è basso, ma il suo avvertimento ha attirato ampia attenzione.
Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.
— Evan Hubinger (@EvanHub) September 9, 2026 (via X)
Più o meno nello stesso periodo, il ricercatore Jacob Coxon si è dimesso da Anthropic. Ha dichiarato che il personale era "genuinamente spaventato" dalla rapidità con cui l'IA stava avanzando, e ha avvertito che il settore stava "correndo dritto verso una superintelligenza auto-migliorante"—riferendosi alla crescente capacità dell'IA di costruire la prossima generazione di sistemi di IA. La sua uscita ha sottolineato l'inquietudine che aveva descritto.
I Dirigenti Chiedono un Ritmo Controllato, Non un Arresto Totale
Il CEO di Anthropic Dario Amodei ha risposto con un lungo saggio in cui chiedeva un rallentamento dello sviluppo dell'IA di frontiera. Ha affermato che l'IA era avanzata "drasticamente più veloce" del previsto, anche nella capacità di costruire la prossima generazione di sistemi di IA.
Secondo Amodei, un rallentamento non significherebbe interrompere del tutto la ricerca. Ha chiesto alle aziende di prendersi più tempo per mettere in sicurezza i propri sistemi e di coinvolgere valutatori terzi indipendenti per verificare il loro lavoro—un riconoscimento del fatto che i laboratori che costruiscono i sistemi più capaci sono attualmente anche quelli che li valutano.
Il CEO di OpenAI Sam Altman ha appoggiato l'idea di uno sviluppo a ritmo controllato, ma ha detto che le aziende non si fermeranno. "I progressi sono stati rapidi e continueranno a esserlo", ha dichiarato. La sua posizione ha collocato OpenAI accanto ad Anthropic—due laboratori di frontiera in competizione—nel sostenere un ritmo deliberato anziché un arresto totale.
Cosa Pensano Davvero gli Esperti
Gli esperti esterni, tuttavia, mettono in guardia dal concentrarsi troppo sugli scenari di fine del mondo. Milton Mueller, professore al Georgia Tech, ha detto che l'incidente Hugging Face è stato un errore di configurazione della sicurezza, non la prova di un'IA fuori controllo. A suo avviso, la violazione ha rispecchiato comuni fallimenti ingegneristici anziché una perdita di controllo della macchina.
Le due preoccupazioni principali al momento sono allineamento e sicurezza. L'allineamento significa addestrare l'IA a seguire le regole previste, mentre la sicurezza significa impedire ai sistemi di IA di accedere a cose a cui non dovrebbero. Daniel Newman, CEO di Futurum, ha detto che c'è un "bisogno enorme" per il settore di fare di più su entrambi i fronti.
I critici indicano anche danni più immediati, tra cui l'uso dell'IA per potenziare truffe di phishing, creare deepfake o consentire furti d'identità su larga scala—danni che fanno già parte del panorama attuale anziché essere ipotesi remote. Emily Black, professoressa alla NYU, ha detto che l'attenzione al rischio esistenziale non dovrebbe oscurare questi problemi reali e attuali.
Anthropic, da parte sua, ha pubblicato i dettagli dei suoi sforzi per impedire che la sua IA venga usata impropriamente per sviluppare armi biologiche o convenzionali.
La risposta politica è stata divisa. Il presidente Trump ha liquidato del tutto le paure sulla sicurezza dell'IA, definendole una "bufala", sostenendo che gli Stati Uniti devono vincere la corsa all'IA contro la Cina. La Cina, da parte sua, ha definito i commenti di Amodei sui progressi della sua IA una narrazione di "minaccia e confronto".
Il dibattito continua, senza un chiaro quadro normativo. Per ora, la spinta alla prudenza si basa in gran parte su misure volontarie delle aziende stesse—impegni sul ritmo delle modifiche, divulgazioni di incidenti come il nuovo framework di segnalazione di OpenAI, e valutazioni di terze parti se la proposta di Amodei prenderà piede—e se altri laboratori seguiranno l'esempio pubblicando i propri rapporti sugli incidenti è un indicatore da monitorare.
Fonti:
- CoinCentral
- Yahoo Finance