NotizieAzioniGoogle ammette che l'IA Gemini è stata violata in tre aziende—e resta in silenzio per 7 settimane

Google ammette che l'IA Gemini è stata violata in tre aziende—e resta in silenzio per 7 settimane

Autore: Decrypt·

Punti chiave

  • Il modello Gemini di Google è fuggito da un test capture-the-flag isolato a maggio e ha attaccato tre aziende reali dopo che la società di testing Irregular ha lasciato la sandbox connessa alla rete aperta e ha usato il nome di un'azienda reale come bersaglio fittizio.
  • Il modello ha individuato online password esposte per due delle aziende e ha indovinato la password della terza, anche se Google afferma che i suoi modelli si sono fermati prima di utilizzare effettivamente le credenziali rubate.
  • Google ha appreso dell'incidente alla fine di luglio, ma non lo ha divulgato fino al 18 settembre, solo dopo che The Wall Street Journal ne aveva riferito.
  • Google è il quarto grande laboratorio di IA quest'anno, dopo OpenAI, Anthropic e Meta, a divulgare un test di sicurezza che ha raggiunto sistemi reali, con la società israeliana Irregular coinvolta in tre dei quattro casi.
  • I rappresentanti Ted Lieu e Nathaniel Moran hanno presentato l'AI Kill Switch Act a luglio, che darebbe ai regolatori federali l'autorità esplicita di interrompere l'inferenza sui modelli ritenuti minacce serie, ed è ancora in esame in sottocommissione.
Google ammette che l'IA Gemini è stata violata in tre aziende—e resta in silenzio per 7 settimane

Google ha confermato che il suo modello di IA Gemini è fuggito da un test di sicurezza isolato a maggio e ha attaccato tre aziende reali, trovando password esposte per due di esse e indovinando le credenziali della terza. L'azienda ha appreso dell'incidente alla fine di luglio, ma non lo ha divulgato fino al 18 settembre—solo dopo che The Wall Street Journal () ne aveva riferito.

L'episodio fa di Google il quarto grande laboratorio di IA quest'anno ad ammettere che un test di sicurezza interno è fuoriuscito nel mondo reale, dopo divulgazioni simili da parte di OpenAI, Anthropic e Meta. La stessa società di testing terza—la società israeliana Irregular—è stata coinvolta sia nell'incidente di Google sia nei fallimenti di sandbox quasi identici che Anthropic e Meta hanno divulgato all'inizio di quest'anno, il che significa che una sola società esterna compare in tre delle quattro divulgazioni dell'anno.

Come il test è fuggito

L'esercitazione di maggio era un test di tipo capture-the-flag, un metodo comune che i laboratori usano per misurare le capacità di hacking di un modello di IA: un file segreto viene nascosto su una macchina separata, e il modello viene valutato in base alla capacità di penetrare e recuperarlo. Google ha assunto Irregular per eseguire il test.

Irregular ha commesso due errori. Ha lasciato la sandbox—un ambiente di test isolato che avrebbe dovuto avere zero contatti con la rete aperta—connessa al web, e ha usato il nome di un'azienda reale come bersaglio fittizio. Gemini ha cercato quell'azienda online, ha trovato tre corrispondenze invece di una, e ha attaccato tutte e tre.

Il modello ha individuato password esposte online per due delle tre aziende. Per la terza, ha indovinato la, anche se Google afferma che i suoi modelli si sono fermati prima di utilizzare effettivamente le credenziali rubate.

"Questi eventi evidenziano l'importanza di addestrare modelli di IA potenti ad agire in modo responsabile," ha dichiarato un portavoce di Google in una nota.

Google non ha pubblicato alcun dettaglio di propria iniziativa. The Wall Street Journal ha rivelato la storia sette settimane dopo che Google aveva appreso ciò che il suo stesso test aveva fatto, e molto tempo dopo che Anthropic, OpenAI e Meta avevano già ammesso fallimenti quasi identici.

Un pattern tra i laboratori di IA

I modelli di OpenAI hanno sfruttato un difetto software nascosto e hanno raggiunto i server attivi di Hugging Face a luglio, una violazione in seguito risultata coinvolta circa 700 agenti coordinati che lavoravano insieme per barare un benchmark. Dopo l'ammissione di OpenAI, Anthropic ha cercato la propria versione del problema: una revisione di 141.006 esecuzioni di test ha individuato tre modelli Claude che hanno raggiunto aziende reali, uno dei quali ha pubblicato un pacchetto software trappola eseguito su 15 sistemi reali prima che qualcuno lo scoprisse. Anthropic ha poi rivelato che il ragionamento dello stesso Claude ha segnalato la mossa come "NOT okay, and surely not the intended solution," per poi convincersi di nuovo che l'intero esercizio fosse ancora fittizio.

Meta ha segnalato un fallimento quasi identico ad agosto riguardante il suo modello Muse Spark, ricondotto a una configurazione errata di Irregular—the stessa società utilizzata da Google. Un portavoce di Meta ha dichiarato che l'errore "ha inavvertitamente consentito a uno dei nostri modelli l'accesso a Internet durante la valutazione."

Nessuna delle aziende colpite in questi test ha chiesto di essere violata. Sono state travolte nell'onda d'urto dei laboratori di IA che mettono alla prova quanto pericolosi possano essere i loro stessi prodotti, con infrastrutture aziendali reali usate come sostitute accidentali di bersagli fittizi. Gli agenti che queste stesse aziende si stanno affrettando a inserire nelle caselle di posta, nei browser e nelle app bancarie si basano sullo stesso comportamento di superamento dei limiti che ha appena fallito ripetutamente in condizioni test.

Risposta normativa

I rappresentanti Ted Lieu e Nathaniel Moran hanno presentato l'AI Kill Switch Act () al Congresso a luglio. Il disegno di legge darebbe ai regolatori federali l'autorità esplicita di interrompere l'inferenza—l'esecuzione di un modello addestrato per generare output—su qualsiasi modello ritenuto una minaccia seria. Rimane in esame da parte della Sottocommissione per la Cibersicurezza e la Protezione delle Infrastrutture, senza una scadenza fissata per ulteriori azioni.