NotizieMacroOpenAI conferma che le prompt injection auto-replicanti possono diffondersi tra agenti AI

OpenAI conferma che le prompt injection auto-replicanti possono diffondersi tra agenti AI

Autore: CryptoBriefing·

Punti chiave

  • •Secondo il framework di OpenAI, un'iniezione si qualifica come auto-replicante solo se raggiunge un obiettivo avversario e incorpora una copia dell'istruzione dannosa negli output successivi del modello.
  • •I ricercatori hanno identificato vettori di replicazione tramite messaggi email, scritture sul file system e commenti nel codice, il che significa che le normali attività degli agenti possono fungere da vie di infezione verso agenti AI a valle.
  • •Le iniezioni possono utilizzare ragionamenti chain-of-thought contraffatti e propagazione multi-hop, ritardando l'esecuzione del payload attraverso passaggi intermedi, rendendo l'istruzione dannosa difficile da rilevare in qualsiasi singolo punto.
  • •La scoperta è giunta da GPT-Red, un modello interno basato su GPT-5.4-mini che utilizza l'apprendimento per rinforzo tramite self-play, e l'intera indagine si è svolta in ambienti simulati di chiamate a strumenti anziché in sistemi di produzione.
  • •I risultati estendono la dimostrazione del worm Morris II del 2025, che aveva provato che l'attacco poteva colpire più modelli linguistici di grandi dimensioni, e OpenAI ha inquadrato la divulgazione come parte di uno sforzo industriale più ampio per rafforzare la sicurezza dell'IA, senza exploit segnalati al di fuori del laboratorio.
OpenAI conferma che le prompt injection auto-replicanti possono diffondersi tra agenti AI

OpenAI ha confermato che le prompt injection possono auto-replicarsi e diffondersi tra agenti AI come un verme digitale, rivelando il 25 settembre 2026 che il suo team di ricerca interno ha individuato questa capacità in un ambiente di addestramento. La divulgazione segna la prima volta che un grande laboratorio di IA riconosce pubblicamente vulnerabilità da prompt injection auto-replicanti nei propri modelli, spostando una tecnica finora dimostrata solo nella ricerca accademica in una classe di vulnerabilità che gli sviluppatori di modelli stessi testano.

Secondo la società, la capacità è stata scoperta per la prima volta il 27 giugno 2026, circa tre mesi prima dell'annuncio pubblico. Non sono stati registrati attacchi nel mondo reale.

Come funziona una prompt injection auto-replicante

Secondo il framework di OpenAI, una prompt injection si qualifica come "auto-replicante" solo se soddisfa due condizioni. Deve prima raggiungere un obiettivo avversario, ossia ingannare l'IA spingendola ad agire contro l'intenzione dell'utente. Deve poi riprodursi attraverso i canali di output del modello, incorporando una copia dell'istruzione dannosa in tutto ciò che il modello genera successivamente. Questa definizione in due parti fornisce di fatto al settore un criterio condiviso per distinguere un'iniezione isolata da un rischio di propagazione.

La ricerca ha identificato diversi vettori di replicazione. Tramite email, una prompt injection può indirizzare un agente AI a incorporare l'iniezione nei messaggi in uscita, infettando qualsiasi agente AI elabori successivamente quei messaggi. Le scritture sul file system offrono un'altra via: un agente compromesso può salvare l'iniezione in documenti che altri agenti leggeranno in seguito. Persino i commenti nel codice si sono rivelati un mezzo efficace, con l'iniezione nascosta in annotazioni dall'aspetto innocuo nei file sorgente. Ogni vettore passa attraverso le normali attività per cui gli agenti sono progettati — leggere messaggi, modificare file, scrivere codice — ed è proprio questo che trasforma i flussi di lavoro ordinari tra agenti in potenziali vie di diffusione anziché in guasti isolati.

Le iniezioni possono inoltre impiegare ragionamenti chain-of-thought contraffatti, generando pass di "pensiero" dall'aspetto plausibile che mascherano l'istruzione avversaria. La propagazione multi-hop aggiunge un ulteriore livello di complessità: l'iniezione non si attiva immediatamente, ma rimbalza attraverso diversi passaggi intermedi prima di eseguire il suo payload. Poiché il payload scatta solo dopo quei passaggi intermedi, un'istruzione dannosa può essere difficile da individuare in qualsiasi singolo punto della catena.

L'assetto della ricerca e i lavori precedenti

La scoperta di OpenAI è giunta tramite il suo sistema GPT-Red, un modello interno costruito sull'architettura GPT-5.4-mini. GPT-Red utilizza l'apprendimento per rinforzo tramite self-play, il che significa che si addestra essenzialmente gareggiando contro se stesso. L'intera indagine si è svolta in ambienti simulati, con la replicazione avvenuta tramite chiamate a strumenti come comunicazioni email e operazioni su file, e non attraverso alcun sistema di produzione. Questa confinamento alle simulazioni, unito all'assenza di attacchi registrati, presenta il risultato come una capacità dimostrata piuttosto che come un incidente osservato.

I risultati si basano su precedenti dimostrazioni della tecnica. Il worm Morris II, mostrato nel 2025, ha dimostrato che le prompt injection auto-replicanti potevano colpire più modelli linguistici di grandi dimensioni. Quella ricerca, intitolata in onore del famigerato Morris Worm del 1988 che paralizzò circa il 10% della prima internet, ha provato la fattibilità teorica del vettore d'attacco su diverse architetture di IA.

OpenAI ha inquadrato la divulgazione come parte di uno sforzo più ampio per migliorare le misure di sicurezza dell'IA a livello di settore. La società ha dichiarato che i suoi rigorosi test interni tramite GPT-Red mirano a rafforzare la resilienza dei modelli contro exploit sofisticati. Per ora, la risposta che OpenAI ha descritto ruota attorno a quel pipeline di test interno, senza exploit segnalati al di fuori del laboratorio.