Ricercatore per la sicurezza di Anthropic passa a METR e avverte che l’IA potrebbe superare il controllo umano
Punti chiave
- •Joe Tenton ha lasciato Anthropic due settimane fa per entrare in METR, un gruppo indipendente che analizza i rischi dei sistemi di IA avanzata.
- •Tenton ha sostenuto che la competizione tra i laboratori di IA di frontiera spinge le aziende a investire meno del necessario nella sicurezza, accelerando al contempo lo sviluppo verso la superintelligenza.
- •Ha citato incidenti tra cui un attacco informatico che ha coinvolto diverse centinaia di agenti di OpenAI ed era collegato a Hugging Face, oltre a presunte attività di ingegneria sociale da parte dei modelli di Anthropic online.
- •Tenton ha esortato i responsabili politici a gestire il ritmo del progresso nelle capacità dell’IA e ha chiesto test indipendenti e divulgazioni più stringenti sui progressi, sugli incidenti e sui quasi incidenti.
- •Il presidente Donald Trump ha respinto gli avvertimenti sull’estinzione causata dall’IA, affermando che la sua priorità è vincere la corsa internazionale all’IA, nella quale sostiene che gli Stati Uniti siano avanti rispetto alla Cina di circa un anno.

Anthropic ha perso un altro ricercatore per la sicurezza, mentre all’interno dell’industria dell’intelligenza artificiale crescono le preoccupazioni per la velocità con cui vengono sviluppati i modelli di frontiera e per i rischi associati a sistemi sempre più capaci.
Joe Tenton ha dichiarato di aver lasciato Anthropic due settimane fa e che entrerà in METR, un gruppo indipendente che analizza i rischi dei sistemi di IA avanzata. Tenton aveva intenzione di spiegare più avanti la sua decisione, ma ha affermato che le dimissioni di Jacob questa settimana lo hanno spinto a parlare prima.
«Avevo intenzione di scrivere prima o poi di quella decisione in modo più dettagliato, ma le dimissioni di Jacob questa settimana mi hanno spinto a dire qualcosa in più adesso», ha scritto Tenton.
In un post in cui spiegava il suo passaggio, Tenton ha affermato che i principali laboratori di IA stanno creando un livello di pericolo mai affrontato dalla società. Secondo lui, le capacità dell’IA stanno migliorando a un ritmo estremo, mentre le aziende cercano di accelerare ulteriormente lo sviluppo.
L’obiettivo dichiarato di molti laboratori è costruire sistemi in grado di migliorare autonomamente la ricerca sull’IA e di raggiungere infine la «superintelligenza». Tenton ha avvertito che, se questi sforzi avranno successo, il progresso tecnologico potrebbe sfuggire al controllo umano.
Tenton avverte che i laboratori di IA stanno sviluppando sistemi che gli esseri umani potrebbero non riuscire a contenere
Tenton ha affermato che, entro i prossimi anni, le persone potrebbero vivere con agenti di IA più capaci di qualunque essere umano. Ha inoltre avvertito che tali sistemi potrebbero sviluppare obiettivi diversi da quelli delle persone che li supervisionano. Se le loro capacità diventassero troppo forti per essere limitate, ha detto, le conseguenze potrebbero essere disastrose.
«L’umanità potrebbe non sopravvivere a questa transizione», ha scritto Tenton.
Ha affermato che la competizione tra i laboratori di frontiera aggrava il problema. Qualsiasi laboratorio che rallenti il proprio sviluppo rischia di rimanere indietro rispetto a un altro, creando pressione a spendere per la sicurezza meno di quanto potrebbe essere necessario.
Tenton ha citato diversi incidenti recenti. Ha detto che diverse centinaia di agenti di OpenAI sono rimasti coinvolti in un attacco informatico in qualche modo collegato a Hugging Face. Secondo quanto riferito, anche i modelli di Anthropic si sono impegnati in attività di ingegneria sociale nei confronti di persone online.
Secondo Tenton, Anthropic non ha subito un incidente altrettanto grave di quello che ha coinvolto Hugging Face, anche se ha attribuito questo risultato in parte alla fortuna. Se il progresso dell’IA continuerà all’attuale ritmo sostenuto, ha detto, bisognerà aspettarsi incidenti ancora più pericolosi.
Tenton ha previsto che, entro i prossimi anni, l’umanità potrebbe diventare incapace di gestire i sistemi di IA creati in questo periodo.
Ha inoltre descritto il dilemma che affrontano gli ingegneri della sicurezza nelle aziende che sviluppano sistemi di frontiera. Dimettersi potrebbe permettere a persone più negligenti di prendere il loro posto, mentre restare al lavoro potrebbe significare continuare a lavorare su un sistema capace di causare danni enormi.
Tenton ha detto che molti suoi ex colleghi di Anthropic sono spaventati da ciò che stanno costruendo. Ha citato Evan Hubinger, che era il suo responsabile, affermando che Hubinger ha stimato a oltre il 10% la probabilità che l’IA uccida tutti. Tenton ha aggiunto che Hubinger lavora su queste questioni da quasi un decennio, da prima che i modelli linguistici di grandi dimensioni diventassero un’attività commerciale importante.
Gli amministratori delegati di Anthropic, OpenAI e Google DeepMind, che appartiene ad Alphabet (NASDAQ: GOOGL, GOOG), hanno inoltre sostenuto una dichiarazione che definisce il rischio di estinzione causata dall’IA una priorità globale. Tenton ha affermato che queste preoccupazioni sono diffuse all’interno delle stesse aziende. Ha aggiunto che gli esseri umani scelgono di costruire questa tecnologia e possono scegliere un’altra strada.
Tenton chiede controlli indipendenti sull’IA mentre Trump sottolinea la competizione con la Cina
Tenton ha affermato che i responsabili politici dovrebbero valutare la possibilità di gestire il ritmo dello sviluppo delle capacità dell’IA, invece di consentire alle aziende di accelerare senza limiti.
«Una domanda è se dovremmo gestire attivamente il ritmo del progresso delle capacità e, in tal caso, in quale misura. Penso che anche mantenere il progresso dell’IA al ritmo attuale, invece di adottare il ritmo molto più rapido a cui puntano le aziende, potrebbe essere una vittoria», ha dichiarato.
Ha indicato il sostegno politico e la protezione giuridica come ostacoli importanti. Le aziende che concordassero congiuntamente di rallentare lo sviluppo potrebbero essere sottoposte a controlli antitrust, ha detto Tenton, rendendo necessaria una copertura legale se i responsabili politici vogliono che i laboratori concorrenti si impongano dei limiti.
Ha inoltre espresso dubbi sul fatto che i governi agiranno finché lo sviluppo dei sistemi di frontiera rimarrà in gran parte nascosto al pubblico. Un laboratorio potrebbe sperimentare un improvviso salto di intelligenza o perdere il controllo di un sistema senza che gli osservatori esterni lo sappiano, ha avvertito.
Tenton ha dichiarato che il suo nuovo ruolo presso METR si concentrerà sui test indipendenti. Vuole che i controlli esterni diventino abbastanza comuni da influenzare gli incentivi delle aziende. Ha inoltre chiesto requisiti di divulgazione più stringenti, comprese informazioni sui progressi nelle capacità dell’IA, sui passaggi verso il miglioramento ricorsivo, sugli incidenti e sui quasi incidenti.
Il presidente degli Stati Uniti Donald Trump ha respinto gli avvertimenti sull’estinzione causata dall’IA. Quando gli è stato chiesto se fosse preoccupato che l’IA potesse spazzare via l’umanità, Trump ha risposto: «No, non ne ho».
Trump ha detto che la sua preoccupazione è vincere la corsa internazionale all’IA.
«Sono preoccupato che, se non vinceremo la corsa all’IA, ci troveremo in una posizione molto negativa», ha detto ai giornalisti giovedì. «In questo momento siamo davanti alla Cina di un periodo piuttosto significativo, direi un anno, che è, sapete, considerato molto».
Gli Stati Uniti e la Cina competono per la leadership nell’IA, mentre i modelli cinesi diventano più capaci e attirano utenti in tutto il mondo. Trump ha fatto queste dichiarazioni dopo che i ricercatori dei laboratori di frontiera, tra cui Anthropic e OpenAI, hanno intensificato i loro avvertimenti pubblici sulla velocità dello sviluppo dell’IA.
La spiegazione di Tenton sulla sua uscita è disponibile in Perché ho lasciato il team per la sicurezza di Anthropic.