OpenAI 證實提示注入可自我複製並在 AI 代理之間傳播
重點速覽
- •根據 OpenAI 的框架,提示注入必須同時達成對抗性目標並將惡意指令副本嵌入模型後續輸出中,才算自我複製。
- •研究人員識別出透過電子郵件、檔案系統寫入和程式碼註解的複製途徑,意味著一般的代理任務可成為感染下游 AI 代理的路徑。
- •這些注入可用虛假思維鏈推理和多跳傳播,將有效載荷執行延遲至多個中間步驟之後,使惡意指令在任何單一環節都難以被偵測。
- •此發現來自 GPT-Red,一個建構在 GPT-5.4-mini 上、以強化學習自我對弈訓練的內部模型,整項調查均在模擬工具呼叫環境中進行,而非生產系統。
- •這些發現延續 2025 年 Morris II 蠕蟲示範——該研究證明此攻擊可影響多個大型語言模型——而 OpenAI 將此次披露定位為加強 AI 安全之更廣泛產業努力的一部分,實驗室外並未傳出任何利用案例。

OpenAI 證實提示注入能夠自我複製,並像數位蠕蟲一樣在 AI 代理之間傳播,並於 2026 年 9 月 25 日披露其內部研究團隊在訓練環境中發現了這項能力。此披露標誌著大型 AI 實驗室首次公開承認自家模型存在自我複製提示注入漏洞,使過去僅在學術研究中展示過的技術,成為模型開發商本身也會測試的漏洞類別。
據該公司表示,這項能力最初於 2026 年 6 月 27 日發現,約在公開披露前三個月。目前並無現實世界攻擊的紀錄。
自我複製提示注入的運作方式
根據 OpenAI 的框架,提示注入必須符合兩項條件才算「自我複製」。首先,它必須達成對抗性目標,即誘騙 AI 做出違背使用者意圖的行為。其次,它必須在模型的輸出通道中自我繁殖,將惡意指令的副本嵌入模型接下來生成的內容中。這個雙重定義實際上為業界提供了一個共同標準,用以區分一次性注入與傳播風險。
這項研究識別出數種複製途徑。透過電子郵件,注入的提示可指示 AI 代理將注入內容嵌入其外寄訊息中,感染下游處理這些訊息的任何 AI 代理。檔案系統寫入則是另一條徑:被入侵的代理可將注入內容儲存到其他代理稍後讀取的文件中。即使是程式碼註解也被證實可行,注入內容可藏身於原始碼檔案中看似無害的註解裡。每條途徑都經由代理被設計來執行的日常工作——閱讀訊息、編輯檔案、撰寫程式碼——這正是將例行代理間工作流程轉化為潛在傳播路徑、而非孤立故障的原因。
這些注入還可運用虛假的思維鏈推理,生成看似合理的「思考」步驟來掩蓋對抗性指令。多跳傳播則增加了另一層複雜性,因為注入不會立即啟動,而是經過多個中間步驟後才執行其有效載荷。由於有效載荷只在這些中間步驟之後才觸發,惡意指令在鏈條中的任何單一環節都很難被察覺。
研究設置與先前研究
OpenAI 的發現來自其 GPT-Red 系統,這是一個建構在 GPT-5.4-mini 上的內部模型。GPT-Red 透過自我對弈使用強化學習,意味著它基本上是透過與自己競爭來訓練。整項調查均在模擬環境中進行,複製行為是透過電子郵件通訊和檔案操作等工具呼叫發生,而非透過任何生產系統。這種對模擬環境的侷限,加上缺乏攻擊紀錄,將此發現定位為已證實的能力,而非已觀察到的事件。
這些發現延續了該技術較早前的示範。2025 年展示的 Morris II 蠕蟲證明自我複製提示注入可影響多個大型語言模型。該研究以 1988 年癱瘓早期網際網路約 10% 的惡名昭彰的 Morris 蠕蟲命名,證明了這種攻擊向量在不同 AI 架構上的理論可行性。
OpenAI 將此次披露定位為改善整個產業 AI 安全措施之更廣泛努力的一部分。該公司表示,其透過 GPT-Red 進行的嚴格內部測試旨在增強模型對複雜攻擊的抵禦能力。目前,OpenAI 所描述的應對措施以該內部測試流程為核心,實驗室外並未傳出任何利用案例。