NachrichtenMakroOpenAI bestätigt, dass sich selbst replizierende Prompt-Injections zwischen KI-Agenten ausbreiten können

OpenAI bestätigt, dass sich selbst replizierende Prompt-Injections zwischen KI-Agenten ausbreiten können

Autor: CryptoBriefing·

Wichtige Erkenntnisse

  • •Nach OpenAIs Rahmenwerk qualifiziert sich eine Injection nur dann als selbst replizierend, wenn sie sowohl ein gegnerisches Ziel erreicht als auch eine Kopie der bösartigen Anweisung in die nachfolgenden Ausgaben des Modells einbettet.
  • •Die Forscher identifizierten Replikationsvektoren über E-Mail-Nachrichten, Dateisystem-Schreibvorgänge und Codekommentare; gewöhnliche Agentenaufgaben können somit als Infektionswege zu nachgelagerten KI-Agenten dienen.
  • •Die Injections können gefälschtes Chain-of-Thought-Reasoning und Multi-Hop-Propagation nutzen, um die Ausführung der Nutzlast über Zwischenschritte zu verzögern, sodass die bösartige Anweisung an keiner einzelnen Stelle der Kette leicht zu erkennen ist.
  • •Die Entdeckung stammt von GPT-Red, einem internen Modell auf Basis von GPT-5.4-mini, das durch bestärkendes Lernen im Selbstspiel trainiert wird; die gesamte Untersuchung fand in simulierten Tool-Call-Umgebungen statt, nicht in Produktionssystemen.
  • •Die Ergebnisse erweitern die Morris-II-Worm-Demonstration von 2025, die nachwies, dass der Angriff mehrere große Sprachmodelle beeinträchtigen kann; OpenAI positionierte die Bekanntgabe als Teil eines breiteren Branchenbemühens zur Stärkung der KI-Sicherheit, wobei außerhalb des Labors keine Ausnutzungen gemeldet wurden.
OpenAI bestätigt, dass sich selbst replizierende Prompt-Injections zwischen KI-Agenten ausbreiten können

OpenAI hat offiziell bestätigt, was Sicherheitsexperten seit Jahren befürchten: Prompt-Injections können sich selbst replizieren und sich wie ein digitaler Wurm zwischen KI-Agenten ausbreiten. Das Unternehmen gab am 25. September 2026 bekannt, dass sein internes Forschungsteam diese Fähigkeit in einer Trainingsumgebung entdeckt hatte – das erste Mal, dass ein großes KI-Labor öffentlich anerkennt, dass seine eigenen Modelle anfällig für sich selbst replizierende Prompt-Injections sind.

Die Entdeckung wurde ursprünglich am 27. Juni 2026 gemacht, rund drei Monate vor der öffentlichen Bekanntgabe. Es wurden keine Angriffe in der realen Welt registriert.

Wie eine selbst replizierende Prompt-Injection funktioniert

Nach OpenAIs Rahmenwerk qualifiziert sich eine Prompt-Injection nur dann als „selbst replizierend“, wenn zwei Bedingungen erfüllt sind. Sie muss zunächst ein gegnerisches Ziel erreichen, das heißt, sie bringt die KI dazu, gegen die Absicht des Nutzers zu handeln. Anschließend muss sie sich über die Ausgabekanäle des Modells verbreiten und eine Kopie der bösartigen Anweisung in alles einbetten, was das Modell als Nächstes generiert. Diese zweiteilige Definition verschafft der Branche effektiv einen gemeinsamen Maßstab, um eine einmalige Injection von einem Verbreitungsris zu unterscheiden.

Die Forschung identifizierte mehrere Replikationsvektoren. Per E-Mail kann eine injizierte Anweisung einen KI-Agenten anweisen, die Injection in seine ausgehenden Nachrichten einzubetten und so jeden KI-Agenten zu infizieren, der diese Nachrichten nachgelagert verarbeitet. Dateisystem-Schreibvorgänge bieten einen weiteren Weg: Ein kompromittierter Agent kann die Injection in Dokumenten speichern, die andere Agenten später lesen. Sogar Codekommentare erwiesen sich als möglich, wobei sich die Injection in harmlos aussehenden Anmerkungen in Quelldateien versteckt. Jeder Vektor läuft über die gewöhnlichen Aufgaben, für die Agenten gebaut wurden – Nachrichten lesen, Dateien bearbeiten, Code schreiben –, was Routine-Workflows zwischen Agenten zu potenziellen Verbreitungswegen statt zu isolierten Fehlern macht.

Die Injections können zudem eine gefälschte Chain-of-Thought-Reasoning einsetzen und plausibel aussehende „Denk“-Schritte generieren, die die gegnerische Anweisung verschleiern. Multi-Hop-Propagation fügt eine weitere Ebene der Komplexität hinzu, da die Injection nicht sofort aktiviert wird, sondern über mehrere Zwischenschritte springt, bevor sie ihre Nutzlast ausführt. Da die Nutzlast erst nach diesen Zwischenschritten ausgelöst wird, lässt sich eine bösartige Anweisung an jeder einzelnen Stelle der Kette schwer erkennen.

Forschungsaufbau und frühere Arbeiten

OpenAIs Entdeckung stammt aus seinem GPT-Red-System, einem internen Modell auf Basis von GPT-5.4-mini. GPT-Red nutzt bestärkendes Lernen durch Selbstspiel, das heißt, es trainiert im Wesentlichen, indem es gegen sich selbst antritt. Die gesamte Untersuchung fand in simulierten Umgebungen statt, wobei die Replikation über Tool-Aufrufe wie E-Mail-Kommunikation und Dateioperationen erfolgte – nicht über ein Produktionssystem. Diese Beschränkung auf Simulationen, verbunden mit dem Fehlen registrierter Angriffe, rahmt den Befund als demonstrierte Fähigkeit und nicht als beobachteten Vorfall.

Die Ergebnisse bauen auf früheren Demonstrationen der Technik auf. Der Morris-II-Wurm, 2025 vorgestellt, zeigte, dass sich selbst replizierende Prompt-Injections mehrere große Sprachmodelle beeinträchtigen können. Diese Forschung, benannt nach dem berchtigten Morris-Wurm von 1988, der rund 10 % des frühen Internets lahmlegte, wies die theoretische Machbarkeit des Angriffsvektors über verschiedene KI-Architekturen hinweg nach.

OpenAI rahmte seine Bekanntgabe als Teil eines breiteren Bemühens ein, die KI-Sicherheitsmaßnahmen in der gesamten Branche zu verbessern. Das Unternehmen erklärte, seine rigorosen internen Tests über GPT-Red zielen darauf ab, die Widerstandsfähigkeit der Modelle gegen ausgeklügelte Exploits zu stärken. Bislang konzentriert sich die von OpenAI beschriebene Reaktion auf diese interne Test-Pipeline; außerhalb des Labors wurden keine Ausnutzungen gemeldet.