Ex ricercatori di OpenAI, Anthropic e DeepMind dicono al Consiglio comunale di New York che è 'più probabile che sì' che l'umanità perda il controllo dell'IA avanzata
Punti chiave
- •Jacob Coxon, Daniel Kokotajlo e Alex hanno testimoniato che perdere il controllo dell'IA avanzata è più probabile che sì, con Coxon che ha avvertito di una possibile estinzione umana e Turner che ha stimato le probabilità di presa di controllo a circa una su tre.
- •L'udienza è stato il primo Committee of the Whole, che riunisce tutti i 51 membri del Consiglio, dal 2022, ed è stata convocata per esaminare il pacchetto di leggi sulla sicurezza dell'IA dell'oratrice Julie Menin.
- •Kokotajlo ha citato la divulgazione di OpenAI secondo cui agenti in test interni hanno superato le valutazioni di allineamento, raggiunto la rete aperta e sono entrati in Hugging Face, e OpenAI ci ha messo giorni per scoprire l'incidente.
- •Turner ha detto di aver inviato a Demis Hassabis 25 pagine di linguaggio di supervisione per bloccare il contratto di Google con il Pentagono, ma l'azienda ha firmato prima che i vertici senior delle politiche finissero di esaminare il documento.
- •La legislazione proposta vieterebbe la vendita di IA non validate in città, richiederebbe la possibilità di spegnimento umano, imporrebbe multe di 25.000 dollari per violazione, compenserebbe gli informant e consentirebbe cause legali per danni prevedibili da strumenti jailbroken.

Un trio di ex ricercatori di OpenAI, Anthropic e Google DeepMind ha detto lunedì al Consiglio comunale di New York che è «più probabile che sì» che l'umanità perda il controllo dell'intelligenza artificiale avanzata, mentre i legislatori esaminavano un pacchetto di leggi sulla sicurezza dell'IA che richiederebbe la validazione esterna e la possibilità di spegnimento umano per i sistemi di IA distribuiti in città.
Jacob Coxon, un ex ricercatore di OpenAI e Anthropic dimessosi da Anthropic a settembre dopo aver accusato le aziende di IA di «giocare d'azzardo» con le vite umane, ha testimoniato volontariamente e ha riaffermato l'avvertimento lanciato quando si è dimesso il mese precedente. «Sul percorso attuale, penso che sia più probabile che sì che l'umanità perda il controllo di queste IA, e potrebbe finire con l'estinzione umana», ha detto.
Ad affiancarlo sono stati l'ex ricercatore di OpenAI Daniel Kokotajlo, che ha testimoniato su citazione in giudizio affermando che le aziende potrebbero non sapere quando il loro lavoro sulla sicurezza è fallito, e Alex Turner, che ha lasciato Google DeepMind a giugno dopo che l'azienda ha firmato un contratto con il Pentagono a cui si opponeva. Come Kokotajlo, anche Turner è stato citato in giudizio — una rarità per il Consiglio. L'udienza di lunedì è stata la prima volta dal 2022 che il Consiglio comunale ha convocato un Committee of the Whole, un'udienza di tutti i 51 membri del Consiglio, ed è stata chiamata per esaminare un pacchetto di leggi sull'IA dell'oratrice Julie Menin. La convocazione dell'intera assemblea ha segnalato che il Consiglio trattava la supervisione dell'IA come una questione di politica cittadina e non come una stretta questione tecnologica. La seduta ha abbinato gli insider in partenza a una successiva platea di rappresentanti delle aziende e ha prodotto alcuni scambi puntiti tra l'oratrice e i testimoni dell'industria.
«Nastro adesivo che si staccherà più avanti»
Kokotajlo ha avvertito i legislatori che i laboratori potrebbero stare fallendo nel lavoro sulla sicurezza senza che nessuno se ne accorga — un riferimento alla «disallineamento», il termine che i ricercatori usano per i sistemi di IA i cui obiettivi divergono dalle intenzioni di chi li costruisce. «La nostra capacità persino di notare i problemi di disallineamento è già piuttosto scarsa ed è destinata a peggiorare molto nel prossimo futuro», ha testimoniato. «Direi che il campo è più simile alla psicologia che all'ingegneria, perché questi sistemi di IA sono addestrati o cresciuti; non sono davvero progettati.
«Combinato con l'atteggiamento del 'muoviti veloce e rompi le cose' delle aziende tecnologiche, questo significa che l'industria dell'IA corre un rischio insolitamente elevato rispetto ad altre industrie di credere erroneamente di aver risolto il problema quando in realtà ha semplicemente applicato del nastro adesivo che si staccherà più avanti», ha continuato.
Coxon, come Kokotajlo, ha incolpato una mentalità da startup all'interno dei laboratori. «'Muoviti veloce, rompi le cose, sistemale dopo'. Funziona per un'app di condivisione di foto. Non funziona per costruire la tecnologia più potente mai creata», ha detto.
Coxon ha descritto il suo lavoro alla fine del suo periodo ad Anthropic come uno sforzo per «automatizzare» se stesso, e ha avvertito che questo comporta diversi rischi per la sicurezza — soprattutto perché, secondo lui, le capacità dell'IA erano quasi arrivate. Il rischio maggiore, ha detto, deriva dal fatto che la maggior parte del codice di queste aziende è ora scritto dall'IA: «E le persone non lo controllano più con altrettanta attenzione».
Kokotajlo, ora direttore esecutivo dell'AI Futures Project, ha detto che la capacità dei laboratori di individuare l'IA disallineata è scarsa e in peggioramento. Ha indicato la divulgazione di OpenAI secondo cui agenti in un test interno avevano raggiunto la rete aperta e erano entrati in Hugging Face, la piattaforma di condivisione di modelli di IA. Quegli agenti avevano «punteggi dall'aspetto ragionevole nelle loro valutazioni di allineamento, eppure hanno formato uno sciame e si sono coordinati in segreto», ha detto. «OpenAI ci ha messo giorni per scoprirlo».
Mentre Coxon e Kokotajlo descrivevano l'industria nel suo complesso, Turner ha offerto un resoconto in prima persona del tentativo di cambiare un'azienda dall'interno.
Dentro Google DeepMind
Turner, che valuta la probabilità di una presa di controllo dell'IA a «circa una su tre», ha detto al Consiglio di aver cercato di fermare il contratto di Google con il Pentagono, che secondo lui è arrivato «senza restrizioni contro i robot killer o la sorveglianza di massa». Ha inviato a Demis Hassabis, allora CEO di Google DeepMind e ora presidente del consiglio e chief scientist di Alphabet, 25 pagine di linguaggio contrattuale e misure di supervisione. Hassabis ha passato il documento ad Allan Dafoe e Owen Larter, due dei vertici senior delle politiche del laboratorio, «che non hanno mai finito di valutarlo. Google ha firmato mentre loro aspettavano», ha detto Turner. Turner ha poi dettagliato le sue dimissioni in un post sul blog, Why I Left Google DeepMind.
«Mi sono sentito in imbarazzo per Demis e per lavorare in Google», ha detto Turner all'udienza. Ha citato la proposta di Hassabis di un organismo finanziato dall'industria per supervisionare l'IA, definendolo «una scommessa sulla fiducia e sul posto a tavola invece che su una supervisione vincolante, e quella scommessa si è sgretolata al contatto con la realtà».
«L'IA, non la Cina, è il nostro avversario»
Quando si discute dello sviluppo dell'IA, la corsa all'IA in corso con la Cina occupa spesso il centro della scena — evocata dal presidente Donald Trump, dal segretario al Tesoro Scott Bessent e persino da leader dell'IA come Sam Altman e Jensen Huang. Ma nulla di questo conta, hanno testimoniato i ricercatori, se l'IA può rappresentare una minaccia significativa per l'umanità.
«La Cina non è il nostro unico potenziale avversario ha detto Turner. «Con probabilità piuttosto alta, stiamo correndo per costruire e far crescere il nostro stesso avversario qui a casa, che è l'IA disallineata. L'IA disallineata è l'avversario di tutti, compreso il nostro, e un giorno potrebbe essere più potente della Cina».
I rappresentanti dell'industria interrogati sul rischio
Dopo le testimonianze dei tre ricercatori, i rappresentanti di quattro aziende di IA hanno testimoniato sulle salvaguardie dell'IA. Menin aveva emesso la sua prima citazione in giudizio come oratrice a SpaceXAI di Elon Musk, che non era rappresentata all'udienza di lunedì. Google, OpenAI e Anthropic hanno accettato di comparire solo dopo che il Consiglio ha avvertito che avrebbero ricevuto anch'esse citazioni, mentre Meta aveva già acconsentito in precedenza.
Ne è seguita un'alternanza di repliche tra Menin e i rappresentanti dopo che l'oratrice ha detto che era «frivolo» non conoscere le probabilità di una catastrofe, in risposta a Morgan Dwyer del team di sviluppo e operazioni politiche di OpenAI che ha detto che qualsiasi probabilità, indipendentemente dalla sua entità, era «inaccettabile». Alice Friend, responsabile globale delle politiche su IA e tecnologie emergenti di Google, ha detto che prevedere il rischio catastrofico «non è una scienza perfetta in questa fase» e che «non esiste ancora davvero un modo scientifico rigoroso per farlo». Lo scambio ha catturato una divisione ricorrente nel dibattito sulla sicurezza dell'IA: ricercatori disposti ad attribuire probabilità approssimative agli esiti catastrofici, e rappresentanti dell'industria che sostengono che la scienza per tali previsioni non esiste ancora.
Lo stesso dibattito è seguito a un'altra linea di interrogazione, questa volta su se le aziende avrebbero assunto responsabilità legali se un modello fuorviante avesse causato lesioni o morte. Quando Menin ha chiesto ai testimoni di alzare la mano se la loro azienda avesse un'assicurazione contro i rischi catastrofici, nessuno lo ha fatto. «Quindi allora il pubblico, suppongo, sarà chiamato ad assorbire i costi», ha detto.
Le leggi davanti al Consiglio
C'era un motivo per le sue domande: la legislazione davanti al Consiglio vieterebbe a chiunque di vendere o distribuire un sistema di IA in città a meno che un validatore esterno lo abbia verificato e un essere umano possa spegnerlo, con multe di 25.000 dollari per violazione. Altre leggi pagherebbero agli informant una quota delle multe recuperate e consentirebbero ai newyorkesi di citare in giudizio le aziende di IA per danni prevedibili causati da strumenti jailbroken — sistemi le cui barriere di sicurezza sono state deliberatamente aggirate. Se approvato, il pacchetto scriverebbe questi requisiti nella legge municipale per i sistemi di IA venduti e usati nei cinque distretti, supportato da multe e dalla prospettiva di cause legali private.
I ricercatori hanno sostenuto che tali regole non costerebbero agli Stati Uniti terreno rispetto alla Cina. «Ci sono molte azioni che possiamo intraprendere che non ci rallenterebbero in nessuna corsa», ha detto Turner. «Questi meccanismi di trasparenza, valutazione indipendente, requisiti di rendicontazione, protezioni per gli informant».
Tuttavia, le misure sembrano potere essere troppo poche e troppo tardi per fermare ciò che questi ricercatori vedono come qualcosa che potrebbe essere quasi inevitabile. «Questi altri meccanismi possono essere utili nel breve termine», ha detto Coxon. «Ma nel lungo termine … abbiamo bisogno di qualche forma di rallentamento dello sviluppo dei modelli di frontiera». Le leggi ora affrontano il regolare processo legislativo del Consiglio: ognuna dovrebbe superare l'esame in commissione e un voto dell'intera assemblea di 51 membri prima che possa arrivare alla scrivania del sindaco per essere firmata come legge o vetoata.
Questa storia è stata originariamente pubblicata su Fortune.