NotizieMacroOpenAI aprirà i propri modelli AI a verifiche di sicurezza indipendenti già durante lo sviluppo

OpenAI aprirà i propri modelli AI a verifiche di sicurezza indipendenti già durante lo sviluppo

Autore: CryptoBriefing·

Punti chiave

  • •OpenAI ha annunciato il 22 settembre che valutatori indipendenti esamineranno i suoi modelli AI in fasi precedenti dello sviluppo, spostando il controllo della sicurezza a monte rispetto alla fase pre-lancio.
  • •Il programma ampliato si concentra su quattro aree: safety case, resilienza delle misure di salvaguardia contro minacce avversarie, valutazioni dei rischi catastrofici nell'ambito della Preparedness Framework e incidenti di disallamento.
  • •Poiché i safety case e la Preparedness Framework sono prodotti internamente, aprirli a revisori esterni introduce un controllo indipendente sulle valutazioni del rischio pre-lancio di OpenAI stessa.
  • •OpenAI ha pubblicato sette principi guida che coprono rigore scientifico, indipendenza dei valutatori, protocolli di sicurezza e metodi responsabili per la pubblicazione dei risultati.
  • •Nessun partner formale è stato annunciato; le discussioni con METR e Redwood Research sono in corso e le condizioni di accesso restano in negoziazione a seguito dell'impegno assunto da Sam Altman il 12 settembre.
OpenAI aprirà i propri modelli AI a verifiche di sicurezza indipendenti già durante lo sviluppo

OpenAI consentirà a gruppi indipendenti di esaminare i suoi modelli AI in fasi precedenti dello sviluppo, come annunciato dall'azienda il 22 settembre. Il cambiamento è pensato per portare alla luce i problemi di sicurezza prima del deployment, anziché quando i modelli sono ormai sostanzialmente completati.

Nel quadro del programma di valutazione ampliato, i revisori indipendenti si concentreranno su quattro aree prioritarie. In primo luogo, valuteranno i "safety case" di OpenAI, ovvero gli argomenti interni dell'azienda su perché un determinato modello sia sicuro da distribuire. In secondo luogo, i valutatori verificheranno la resilienza delle misure di salvaguardia critiche contro le minacce avversarie. In terzo luogo, le valutazioni saranno collegate direttamente alla Preparedness Framework di OpenAI, il sistema interno che l'azienda utilizza per misurare i rischi catastrofici prima del lancio. In quarto luogo, i valutatori indagheranno gli incidenti di disallineamento, una categoria che ha acquisito urgenza dopo una violazione che ha coinvolto Hugging Face e che ha evidenziato quanto rapidamente tali guasti possano degenerare.

Poiché i safety case e la Preparedness Framework sono prodotti internamente, aprirli a revisori esterni introduce un controllo indipendente su come OpenAI stessa valuta il rischio prima del lancio.

OpenAI ha inoltre pubblicato settei guida che disciplinano come queste valutazioni dovrebbero essere condotte. I principi sottolineano il rigore scientifico, l'indipendenza dei valutatori, i protocolli di sicurezza e i metodi responsabili per la pubblicazione dei risultati. L'azienda ha avviato discussioni con organizzazioni come METR e Redwood Research, entrambe già collaboratrici di OpenAI in ambito di sicurezza. I nuovi partner non sono stati formalmente annunciati e le specifiche condizioni di accesso restano in fase di negoziazione; come verranno definite queste condizioni contribuirà a determinare l'effettivo accesso dei valutatori.

L'iniziativa si basa sull'impegno assunto dal CEO Sam Altman il 12 settembre, quando ha indicato che i valutatori sarebbero stati integrati più a fondo nella struttura operativa di OpenAI.

Come si è evoluto l'approccio di OpenAI alla sicurezza

I protocolli di sicurezza di OpenAI si sono notevolmente ampliati dall'era GPT-4, quando l'azienda iniziò per la prima volta a invitare red-teamer esterni a testare i suoi modelli prima del rilascio. Quei primi sforzi erano più limitati in portata, in genere concentrati sulle fasi finali prima del lancio. Il nuovo quadro sposta questo coinvolgimento significativamente a monte nella timeline di sviluppo, dando ai valutatori l'opportunità di identificare i rischi quando c'è ancora tempo per affrontarli.

Considerazioni su talenti e competitività

La comunità di ricerca sulla sicurezza AI è relativamente piccola, e organizzazioni come METR e Redwood Research sono tra le voci più credibili del settore. Approfondendo i rapporti con questi gruppi, OpenAI acquisisce sia competenze pratiche sia capitale reputazionale. Per i valutatori, l'accordo offre un vantaggio altrettanto prezioso: l'accesso a sistemi all'avanguardia che altrimenti resterebbero dietro porte chiuse.

La credibilità del programma dipenderà in parte da ciò che accadrà quando una valutazione indipendente porterà alla luce risultati in conflitto con gli interessi commerciali di OpenAI. I sette principi richiedono esplicitamente metodi di pubblicazione responsabili, ma la tensione tra trasparenza e vantaggio competitivo rimane. Se OpenAI gestirà questa tensione in modo credibile, il programma potrebbe diventare un modello per standard di sicurezza a livello di settore. Gli indicatori da monitorare nel breve termine sono concreti: quali organizzazioni verranno formalmente annunciate come partner, quali condizioni di accesso verranno infine concordate e come verranno diffusi i primi risultati.