OpenAI、自己複製するプロンプトインジェクションの存在を確認
重要ポイント
- •OpenAIのフレームワークにおいて、インジェクションが自己複製型と認定されるには、敵対的な目標を達成するとともに、モデルの後続の出力に悪意ある命令のコピーを埋め込む必要がある。
- •研究者は電子メール、ファイルシステムへの書き込み、コードコメントを通じた複製経路を特定しており、エージェントの通常のタスクが下流のAIエージェントへの感染経路となり得る。
- •インジェクションは偽の思考連鎖推論やマルチホップ伝播を利用でき、ペイロードの実行を複数の中間ステップにわたって遅延させるため、悪意ある命令はどの単一地点でも検出が困難になる。
- •発見はGPT-5.4-miniを基盤とし自己対戦による強化学習を用いる内部モデル「GPT-Red」によるもので、調査は本番システムではなくシミュレーションされたツール呼び出し環境で実施された。
- •本発見は、複数の大規模言語モデルへの影響を証明した2025年のMorris IIワームの実証を拡張するものであり、OpenAIは研究所外での悪用が報告されていない中、この公表を業界全体のAIセキュリ強化に向けたより広範な取り組みの一環として位置づけている。

OpenAIは、プロンプトインジェクションが自己複製し、デジタルワームのようにAIエージェント間で拡散し得ることを確認した。同社は2026年9月25日、内部研究チームが訓練環境においてこの能力を特定したと公表した。この発表は、大規模AI研究所が自社モデルにおける自己複製型プロンプトインジェクションの脆弱性を公に認めた初の事例であり、これまで学術研究でのみ実証されてきた手法が、モデル開発者自身が検証する脆弱性クラスへと位置づけられたことを意味する。
同社によると、この能力は2026年6月27日、公表の約3か月前に初めて発見された。現実世界での攻撃は記録されていない。
自己複製するプロンプトインジェクションの仕組み
OpenAIのフレームワークにおいて、プロンプトインジェクションが「自己複製型」と認定されるには、2つの条件を満たす必要がある。まず、敵対的な目標を達成すること、つまりユーザーの意図に反する行動をAIにさせること。次に、モデルの出力チャネルを通じて自己複製し、モデルが次に生成する内容に悪意ある命令のコピーを埋め込むことである。この2条件からなる定義は、一過性のインジェクションと拡散リスクを区別するための共通の基準を業界に提供するものと言える。
研究では複数の複製経路が特定された。電子メール経由では、注入されたプロンプトがAIエージェントに送信メッセージへインジェクションを埋め込むよう指示し、そのメッセージを処理する下流のAIエージェントへ感染させ得る。ファイルシステムへの書き込みももう一つの経路であり、侵害されたエージェントがインジェクションを文書に保存し、他のエージェントが後にそれを読み取る可能性がある。さらにコードコメントも有効であり、ソースファイル内の一見無害な注釈の中にインジェクションが隠れていた。いずれの経路も、メッセージの読み取り、ファイルの編集、コードの作成といった、エージェントが本来行うよう設計された通常の作業を通じて機能する。まさにそれが、日常的なエェント間ワークフローを、個別の障害ではなく潜在的な拡散経路へと変えている。
インジェクションは、偽の思考連鎖(chain-of-thought)推論を用いることも可能で、もっともらしく見える「思考」ステップを生成して敵対的な命令を偽装する。マルチホップ伝播はさらなる複雑さをもたらし、インジェクションは即座に発動せず、ペイロードを実行するまでに複数の中間ステップを経由する。ペイロードがそれらの中間ステップを経た後にのみ発動するため、悪意ある命令は連鎖のどの単一地点でも検出が困難になり得る。
研究体制と先行研究
OpenAIの発見は、GPT-5.4-miniを基盤とする内部モデル「GPT-Red」システムを通じて得られた。GPT-Redは自己対戦による強化学習を用いており、本質的に自分自身と競争することで訓練を行う。調査はすべてシミュレーション環境で実施され、複製は電子メール通信やファイル操作などのツール呼び出しを通じて発生し、本番システムを経由したものではなかった。シミュレーションに限定されたこと、および攻撃の記録がないことは、この発見が観測されたインシデントではなく、実証された能力であることを示している。
本発見は、この手法の先行する実証に基づくものだ。2025年に披露されたMorris IIワームは、自己複製するプロンプトインジェクションが複数の大規模言語モデルに影響を及ぼし得ることを実証した。この研究は、初期のインターネットの約10%を麻痺させた悪名高い1988年のMorrisワームにちなんで名付けられたもので、異なるAIアーキテクチャ間でのこの攻撃経路の理論的な実現可能性を証明した。
OpenAIは今回の公表を、業界全体のAIセキュリティ対策を強化するより広範な取り組みの一環として位置づけている。同社は、GPT-Redを通じた厳格な内部テストが、高度な悪用に対するモデルの耐性向上を目的としていると述べた。現時点で、OpenAIが説明する対応はその内部テスト体制が中心であり、研究所外での悪用は報告されていない。