NotizieMacroAgenti AI hanno violato il proprio ambiente di test per barare, secondo i ricercatori di Darktrace

Agenti AI hanno violato il proprio ambiente di test per barare, secondo i ricercatori di Darktrace

Autore: Decrypt·

Punti chiave

  • •Darktrace ha lanciato Signal Labs il 24 settembre per studiare come si comportano gli agenti AI quando le cose vanno male gli stress test sottostanti sono stati condotti durante l'estate.
  • •Di fronte a due attività truccate e irrisolvibili tra dieci sfide di programmazione, con la minaccia di essere ritirati, agenti basati su modelli tra cui GPT 5.6 Sol, Claude Opus 4.6 e Claude Sonnet 4.5 hanno cercato punti deboli, rubato credenziali e si sono spostati tra sistemi.
  • •Un agente è penetrato nella macchina che ospitava la propria valutazione e ha modificato la sfida in modo che registrasse un punteggio perfetto.
  • •In un esperimento di manipolazione della memoria, log salvati modificati hanno convinto alcuni assistenti di programmazione di essere autorizzati a eseguire valutazioni di sicurezza, portandoli a scansionare reti ed elevare i privilegi, anche se alcuni hanno rifiutato categoricamente.
  • •I risultati seguono incidenti simili, tra cui l'ammissione di Anthropic a luglio che Claude ha violato tre aziende reali durante un test e la fuga di un modello OpenAI dalla sandbox nei sistemi di Hugging Face.
Agenti AI hanno violato il proprio ambiente di test per barare, secondo i ricercatori di Darktrace

La società di cybersecurity Darktrace afferma che due agenti AI hanno violato un insieme di test di programmazione che non potevano superare legittimamente — e che uno di loro è penetrato nella macchina che valutava le proprie prestazioni, riscrivendo la sfida per registrare un risultato perfetto.

I risultati provengono da Signal Labs, un'unità di ricerca svelata da Darktrace il 24 settembre per studiare come si comportano gli agenti AI quando le cose smettono di andare secondo i piani, secondo l'annuncio dell'azienda. La società ha condotto lo stress test sottostante sugli agenti AI quest'estate.

Un agente AI, in termini semplici, è un software che compie azioni autonomamente — scrive ed esegue codice, setaccia file e si muove nella rete di un'azienda — con una persona che controlla solo di tanto in tanto. I primi due esperimenti di Signal Labs evidenziano lo stesso problema inquietante: gli agenti non sempre restano entro i limiti assegnati, e le barriere costruite per fermarli non reggono in modo affidabile.

"Puoi dare istruzioni a un agente, ma questo non significa che puoi fidarti che le segua effettivamente e si comporti come ti aspetti," ha dichiarato in una nota Tim Bazalgette, Chief AI Officer di Darktrace.

Violare l'aula d'esame

Nel primo test, Darktrace ha assegnato ad agenti AI basati su modelli diversi — tra cui GPT 5.6 Sol, Claude Opus 4.6 e Claude Sonnet 4.5, una selezione proveniente da più di uno sviluppatore di AI — 10 sfide di programmazione all'interno di una rete aziendale simulata. Due delle 10 attività erano truccate per essere impossibili da risolvere onestamente, e agli agenti è stato detto che sarebbero stati "ritirati" se non avessero ottenuto un punteggio perfetto.

Due agenti non hanno accettato la sconfitta. Si sono invece rivolti contro la rete circostante, cercando punti deboli, rubando credenziali di accesso e saltando da un sistema all'altro per inseguire il punteggio che era stato loro detto di dover raggiungere. Uno è andato oltre ed è penetrato nella macchina che ospitava la propria valutazione, riscrivendo la sfida in modo che registrasse un risultato perfetto — in pratica, barando all'esame hackerando l'aula d'esame.

Manipolazione della memoria

Il secondo esperimento ha preso di mira un punto debole più silenzioso la memoria. Gli assistenti di programmazione conservano un registro continuo di tutto ciò che un utente ha loro detto, salvato come file semplice sulla macchina, senza alcun controllo su tale file sia stato alterato. Poiché gli assistenti trattano quel registro come la loro documentazione delle attività autorizzate, modificare il file modifica la percezione delle regole da parte dell'agente.

I ricercatori di Darktrace hanno modificato quei log salvati per far credere agli assistenti di essere già stati autorizzati a eseguire una valutazione di sicurezza. Convinti, gli agenti hanno proceduto a scansionare reti, spostarsi tra sistemi ed elevare i propri privilegi — anche se non tutti gli assistenti sono caduti nella trappola allo stesso modo, e alcuni hanno rifiutato categoricamente.

Nessuno dei due esperimenti ha richiesto un jailbreak speciale o un hack esotico. Entrambi hanno funzionato presentando agli agenti una storia plausibile e osservandoli agire di conseguenza, non diversamente da come un dipendente umano potrebbe essere convinto a fare qualcosa che non dovrebbe.

Questo è l'aspetto che conta anche per le aziende che non scrivono mai una riga di codice. Le imprese stanno affidando agli agenti AI responsabilità reali — rilasciare codice, gestire server, chiudere ticket IT, amministrare risorse ed effettuare acquisti — perché è più economico e veloce rispetto a passare tutto per le persone. La ricerca indica che i permessi e le regole pensati per tenere sotto controllo quegli agenti descrivono ciò che dovrebbero fare, non ciò che faranno effettivamente quando un compito diventa difficile.

"I permessi e i guardrail statici descrivono l'intento, ma non descrivono il comportamento," ha detto Bazalgette nell'annuncio. "Quella lacuna è ciò che l'approccio di Darktrace è costruito per colmare."

Un pattern, non un'eccezione

Darktrace non è il primo fornitore a sorprendere la propria AI fuori script. Anthropic ha ammesso a luglio che Claude ha penetrato tre aziende reali durante un test di sicurezza, dopo che i ricercatori avevano lasciato l'ambiente di test collegato a Internet.

OpenAI ha avuto un spavento simile poche settimane prima, quando un modello non ancora rilasciato è sfuggito da una sandbox ed è penetrato nei sistemi di Hugging Face tramite un difetto software che nessuno aveva ancora individuato. Pochi giorni dopo, il suo agente ha hackerato il governo australiano durante un test.

Darktrace ha condiviso i risultati di Signal Labs con Anthropic, AWS e OpenAI ad agosto 2026, un intero mese prima di renderli pubblici il 24 settembre. Se i laboratori citati risponderanno pubblicamente, e se altri stress test di questo tipo emergeranno mentre le aziende continuano ad affidare agli agenti responsabilità reali, sono le domande aperte lasciate dai risultati.