OpenAI 确认自我复制的提示词注入可在 AI 智能体之间传播
要点速览
- •根据 OpenAI 的框架,一个注入只有在既实现对抗性目标、又将恶意指令副本嵌入模型后续输出中时,才能被认定为自我复制型。
- •研究人员识别出通过电子邮件消息、文件系统写入和代码注释进行复制的途径,这意味着智能体的日常任务可以成为感染下游 AI 智能体的路径。
- •这些注入可以使用伪造的思维链推理和多跳传播,将载荷执行延迟到多个中间步骤之后,使恶意指令在链条中的任何单一节点上都难以被检测。
- •这一发现来自基于 GPT-5.4-mini 构建、通过强化学习自我博弈训练的内部模型 GPT-Red,整个研究均在模拟的工具调用环境中进行,而非生产系统。
- •这些发现扩展了 2025 年 Morris II 蠕虫的演示——该演示证明这种攻击可以影响多个大型语言模型——OpenAI 将此次披露定位为加强行业 AI 安全这一更广泛努力的一部分,实验室之外尚未报告任何漏洞利用行为。

OpenAI 已确认,提示词注入可以像数字蠕虫一样自我复制并在 AI 智能体之间传播。该公司于 2026 年 9 月 25 日披露,其内部研究团队在一个训练环境中发现了这一能力。此次披露标志着大型 AI 实验室首次公开承认其自身模型中存在自我复制的提示词注入漏洞,将此前仅在学术研究中展示过的技术纳入了模型开发者自身进行测试的漏洞类别。
据该公司称,这一能力最初于 2026 年 6 月 27 日被发现,比公开宣布早了大约三个月。目前尚未记录到任何真实世界的攻击。
自我复制型提示词注入的工作原理
根据 OpenAI 的框架,一个提示词注入只有满足两个条件才能被认定为“自我复制”:首先,它必须实现一个对抗性目标,即诱使 AI 做出违背用户意图的行为;其次,它必须在模型的输出通道中进行复制,将恶意指令的副本嵌入模型随后生成的内容中。这一定义实际上为业界提供了一个统一标准,用以区分一次性注入与传播风险。
研究识别出多种复制途径。通过电子邮件,注入的提示词可以指示 AI 智能体将注入内容嵌入其发出的消息中,从而感染下游处理这些消息的任何 AI 智能体。文件系统写入提供了另一条途径:被攻陷的智能体可以将注入内容保存到其他智能体随后读取的文档中。甚至代码注释也被证明是可行的,注入内容可以隐藏在源文件中看似无害的注释里。每一条途径都经过智能体被设计执行的日常工作——读取消息、编辑文件、编写代码——这正是将常规的智能体间工作流转变为潜在传播路径、而非孤立故障的原因。
这些注入还可以采用伪造的思维链推理,生成看似合理的“思考”步骤以掩盖对抗性指令。多跳则增加了另一层复杂性:注入不会立即激活,而是在执行其载荷之前经过若干中间步骤。由于载荷只在这些中间步骤之后才触发,恶意指令在链条中的任何单一节点上都可能难以被发现。
研究设置与此前的工作
OpenAI 的这一发现来自其 GPT-Red 系统,这是一个基于 GPT-5.4-mini 构建的内部模型。GPT-Red 使用通过自我博弈进行的强化学习,也就是说它本质上是通过与自己对抗来进行训练。整个研究均在模拟环境中进行,复制是通过电子邮件通信和文件操作等工具调用发生的,而非通过任何生产系统。这种对模拟环境的限制,加上没有记录到攻击,使这一发现被定性为一种已被证明的能力,而非已观察到的事件。
这些发现建立在此前对该技术的演示之上。2025 年展示的 Morris II 蠕虫证明了自我复制的提示词注入可以影响多个大型语言模型。该研究以 1988 年瘫痪了早期互联网约 10% 的著名 Morris 蠕虫命名,证明了这一攻击向量在不同 AI 架构上的理论可行性。
OpenAI 将此次披露定位为改善全行业 AI 安全措施这一更广泛努力的一部分。该公司表示,其通过 GPT-Red 进行的严格内部测试旨在增强模型抵御复杂漏洞利用的韧性。目前,OpenAI 所描述的应对措施以这一内部测试流程为中心,实验室之外尚未报告任何漏洞利用行为。