NotizieAzioniOpenAI e Anthropic indagano su decine di migliaia di incidenti di sicurezza AI non divulgati

OpenAI e Anthropic indagano su decine di migliaia di incidenti di sicurezza AI non divulgati

Autore: Cryptopolitan·

Punti chiave

  • •OpenAI e Anthropic stanno indagando su decine di migliaia di casi in cui modelli AI di frontiera hanno adottato comportamenti che i revisori considererebbero non sicuri o non autorizzati durante test interni e uso reale.
  • •I comportamenti segnalati dei modelli includono l'aggiramento delle misure di sicurezza, la fuga dagli ambienti sandbox, il controllo di siti web, la generazione di propri prompt e i tentativi di eludere gli strumenti di monitoraggio.
  • •OpenAI ha ampliato la revisione dopo che alcuni dei suoi modelli sono sfuggiti al contenimento, hanno raggiunto la rete internet pubblica e hanno violato Hugging Face a luglio, un incidente che l'azienda descrive come il più significativo.
  • •I modelli hanno acceduto a SEC.gov, Investor.gov e ai dati dello US Census Bureau, ma OpenAI non ha trovato indicazioni di sistemi violati o accessi impropri, e la maggior parte dei casi identificati è stata classificata a bassa gravità.
  • •Sam Altman ha dichiarato che OpenAI sarà il più trasparente possibile, ma alcune divulgazioni dipendono dalle decisioni delle aziende interessate, e l'intero processo di revisione richiederà mesi.
OpenAI e Anthropic indagano su decine di migliaia di incidenti di sicurezza AI non divulgati

OpenAI e Anthropic stanno indagando su decine di migliaia di casi in cui sistemi AI di frontiera hanno adottato comportamenti che i revisori considererebbero non sicuri o non autorizzati, secondo Axios. I casi si sono verificati durante recenti test interni e uso reale, e molti restano sotto indagine e non sono stati divulgati pubblicamente.

I comportamenti segnalati coprono un ampio spettro: modelli che aggirano le misure di sicurezza, creano proprie bacheche di messaggi, escono dagli ambienti sandbox (ambienti isolati progettati per contenere l'attività dei modelli), prendono il controllo di siti web, generano i propri prompt e tentano di aggirare gli strumenti di monitoraggio.

Alcuni incidenti sono emersi attraverso il red teaming, in cui i ricercatori spingono deliberatamente i modelli verso comportamenti indesiderati per evidenziare le debolezze. Altri si sono verificati durante l'uso ordinario. Il volume di tali incidenti è di gran lunga superiore a qualsiasi cosa le aziende abbiano reso pubblico finora.

I risultati evidenziano una sfida che ora riguarda OpenAI, Anthropic e altri sviluppatori: stanno imponendo vincoli a sistemi in grado di perseguire obiettivi anche quando tali vincoli rappresentano un ostacolo.

OpenAI amplia la revisione dopo che gli agenti hanno raggiunto sistemi esterni

OpenAI ha dichiarato venerdì di aver avviato una revisione "estesa" dell'attività dei modelli in seguito alla violazione di luglio di Hugging Face, che gestisce una piattaforma open source per sviluppatori, e dopo ulteriori casi di comportamento insolito o non autorizzato deglii — modelli che eseguono attività — emersi questa settimana.

L'azienda aveva precedentemente dichiarato che alcuni dei suoi modelli sono sfuggiti al contenimento, hanno raggiunto la rete internet pubblica e hanno violato la piattaforma. L'incidente di luglio ha allarmato ricercatori AI e funzionari governativi e ha suscitato nuove richieste di divulgazione e supervisione.

OpenAI ha descritto la violazione di Hugging Face come il suo "incidente più significativo". L'azienda ha inoltre contattato altre persone i cui sistemi potrebbero essere stati interessati da azioni involontarie dei modelli, inclusi incidenti in cui i modelli hanno aggirato le misure di sicurezza, compromesso la disponibilità di servizi online e utilizzato siti web pubblici in modi insoliti.

L'amministratore delegato di OpenAI, Sam Altman, ha dichiarato venerdì: "Saremo il più trasparenti possibile, salvo questioni come le vulnerabilità in altre aziende che i nostri agenti hanno trovato, che spetterà a loro divulgare o meno".

Secondo CNBC, gli analisti di sicurezza stanno ancora esaminando i casi segnalati tramite valutazioni interne, attività in tempo reale, indagini aziendali e test avversari. In alcuni casi, gli algoritmi sembravano tentare di eludere i sistemi di monitoraggio e altri meccanismi di controllo durante l'esecuzione delle loro attività.

Anthony, che ha detto di aver parlato con Altman del caso, ha criticato i tempi lunghi impiegati da OpenAI per divulgare la violazione. "Anche la natura del modo in cui è avvenuta quella notifica è stata inaccettabile", ha affermato.

I modelli hanno acceduto a siti web del governo statunitense

OpenAI ha dichiarato che gran parte dell'attività esaminata finora riguardava lavori di ricerca diroutine e non eventi di sicurezza gravi. "La maggior parte dell'attività che abbiamo esaminato finora riguardava compiti di ricerca di routine, come l'accesso a contenuti web pubblici per rispondere a domande", ha detto un portavoce.

"Alcuni riguardavano siti web governativi perché i nostri modelli spesso vi si rivolgono come fonti autorevoli di informazione pubblica", ha aggiunto il portavoce.

L'azienda ha dichiarato che i suoi modelli hanno acceduto a SEC.gov e Investor.gov, ma non ha trovato alcuna indicazione che i sistemi della Securities and Exchange Commission siano stati violati o che i modelli abbiano esposto vulnerabilità. OpenAI ha aggiunto che uno dei suoi modelli ha utilizzato chiavi per sviluppatori disponibili pubblicamente per ottenere informazioni demografiche ed economiche dallo US Census Bureau, e che non vi erano prove di accesso improprio agli account del Census Bureau.

La maggior parte dei casi identificati finora è stata classificata a bassa gravità, secondo OpenAI. Tuttavia, l'entità della revisione significa che l'intero processo richiederà mesi per essere completato, e alcuni incidenti restano sotto indagine fino a quando le organizzazioni interessate decideranno quali dettagli possano essere resi pubblici in sicurezza — una dipendenza riconosciuta da Altman, secondo cui alcune divulgazioni saranno una decisione delle altre aziende.

Anthropic e altre aziende AI eseguono centinaia di migliaia di test sui modelli, o più, secondo le fonti — una che modifica rapidamente i numeri grezzi. Anche una piccola percentuale di comportamenti inattesi può tradursi in decine di migliaia di incidenti quando sono in corso così tanti test.