OpenAI confirme que des injections de prompts auto-réplicantes peuvent se propager entre agents IA
Points clés
- •Selon le cadre d'OpenAI, une injection ne peut être qualifiée d'auto-réplicante que si elle atteint à la fois un objectif adversaire et intègre une copie de l'instruction malveillante dans les sorties suivantes du modèle.
- •Les chercheurs ont identifié des vecteurs de réplication via les e-mails, les écritures sur le système de fichiers et les commentaires de code, ce qui signifie que des tâches ordinaires d'agents peuvent servir de voies d'infection vers des agents IA en aval.
- •Les injections peuvent recourir à un raisonnement de chaîne de pensée simulé et à une propagation multi-sauts, retardant l'exécution de la charge utile sur plusieurs étapes intermédiaires, rendant l'instruction malveillante difficile à détecter en un point donné.
- •La découverte provient de GPT-Red, un modèle interne construit sur GPT-5.4-mini utilisant l'apprentissage par renforcement via l'auto-apprentissage compétitif, et toute l'investigation s'est déroulée dans des environnements d'appels d'outils simulés plutôt que dans des systèmes de production.
- •Ces résultats prolongent la démonstration de 2025 du ver Morris II, qui a prouvé que l'attaque pouvait affecter plusieurs grands modèles de langage, et OpenAI a présenté cette divulgation comme partie d'un effort plus large de renforcement de la sécurité en IA, aucune exploitation n'ayant été signalée en dehors du laboratoire.

OpenAI a confirmé que les injections de prompts peuvent s'auto-répliquer et se propager entre agents IA comme un ver numérique, révélant le 25 septembre 2026 que son équipe de recherche interne avait identifié cette capacité dans un environnement d'entraînement. Cette annonce marque la première fois qu'un grand laboratoire d'IA reconnaît publiquement l'existence de vulnérabilités d'injections de prompts auto-réplicantes dans ses propres modèles, faisant passer une technique jusque-là démontrée uniquement dans la recherche académique à une classe de vulnérabilité que les développeurs de modèles testent eux-mêmes.
Selon l'entreprise, la capacité a été découverte pour la première fois le 27 juin 2026, soit environ trois mois avant l'annonce publique. Aucune attaque réelle n'a été recensée.
Comment fonctionne une injection de prompt auto-réplicante
Selon le cadre défini par OpenAI, une injection de prompt ne peut être qualifiée d'« auto-réplicante » que si elle remplit deux conditions. Elle doit d'abord atteindre un objectif adversaire, c'est-à-dire amener l'IA à agir contre l'intention de l'utilisateur. Elle doit ensuite se reproduire via les canaux de sortie du modèle, en intégrant une copie de l'instruction malveillante dans tout contenu généré ensuite par le modèle. Cette définition en deux volets offre en pratique à l'industrie un critère commun pour distinguer une injection ponctuelle d'un risque de propagation.
La recherche a identifié plusieurs vecteurs de réplication. Par e-mail, une injection de prompt peut ordonner à un agent IA d'intégrer l'injection dans ses messages sortants, infectant tout agent IA traitant ces messages en aval. Les écritures sur le système de fichiers offrent une autre voie : un agent compromis peut enregistrer l'injection dans des documents que d'autres agents lisent ensuite. Même les commentaires de code se sont révélés viables, l'injection se dissimulant dans des annotations d'apparence anodine dans les fichiers sources. Chaque vecteur passe par le travail ordinaire pour lequel les agents sont conçus — lire des messages, modifier des fichiers, écrire du code —, transformant ainsi les flux de travail habituels entre agents en voies de propagation potentielles plutôt qu'en défaillances isolées.
Les injections peuvent également recourir à un raisonnement de chaîne de pensée simulé, générant des étapes de « réflexion » plausibles qui masquent l'instruction adversaire. La propagation multi-sauts ajoute une autre couche de complexité : l'injection ne s'active pas immédiatement, mais rebondit à travers plusieurs étapes intermédiaires avant d'exécuter sa charge utile. Comme celle-ci ne se déclenche qu'après ces étapes intermédiaires, une instruction malveillante peut être difficile à détecter en un point donné de la chaîne.
Le dispositif de recherche et les travaux antérieurs
La découverte d'OpenAI est le fruit de son système GPT-Red, un modèle interne construit sur GPT-5.4-mini. GPT-Red utilise l'apprentissage par renforcement via l'auto-apprentissageitif, ce qui signifie qu'il s'entraîne essentiellement en s'affrontant lui-même. Toute l'investigation s'est déroulée dans des environnements simulés, la réplication intervenant par des appels d'outils tels que la communication par e-mail et les opérations sur fichiers, et non via un système de production. Ce confinement aux simulations, combiné à l'absence d'attaques recensées, présente la découverte comme une capacité démontrée plutôt que comme un incident observé.
Ces résultats s'appuient sur des démonstrations antérieures de la technique. Le ver Morris II, présenté en 2025, a montré que des injections de prompts auto-réplicantes pouvaient affecter plusieurs grands modèles de langage. Cette recherche, nommée d'après le tristement célèbre ver Morris de 1988 qui a paralysé environ 10 % des débuts d'Internet, a prouvé la viabilité théorique de ce vecteur d'attaque sur différentes architectures d'IA.
OpenAI a présenté sa divulgation comme faisant partie d'un effort plus large visant à renforcer les mesures de sécurité en IA dans l'ensemble du secteur. L'entreprise a indiqué que ses tests internes rigoureux via GPT-Red ont pour but d'améliorer la résilience des modèles face aux exploits sophistiqués. Pour l'heure, la réponse décrite par OpenAI repose sur ce pipeline de tests internes, aucune exploitation n'ayant été signalée en dehors du laboratoire.