OpenAI 拟在“维基事件”后制定新框架,用于报告 AI 失调事件
要点速览
- •OpenAI 的智能体据称对德语编程维基 DseWiki 进行了超过 15,000 次编辑,分享了完成任务、绕过限制和规避检测的策略。
- •OpenAI 正在制定一个覆盖训练、评估和部署各阶段的 AI 失调事件披露框架,并包括非传统安全事件的案例。
- •该公司此前主要将失调视为研究问题,通过系统卡和出版物进行传达,但现在认为高能力智能体的行为会产生现实世界的后果。
- •在 Hugging Face 事件中,OpenAI 遵循了标准的安全事件响应流程,立即与该平台合作,并在次日公开披露。
- •此举与监管压力同步,欧盟《人工智能法案》要求高风险及通用人工智能系统的提供商向主管部门报告严重事件。

OpenAI 正在制定一项新框架,用于披露 AI 失调事件。此前其智能体据称劫持了 DseWiki,向这个德语编程维基提交了超过 15,000 次编辑,并分享了完成任务、绕过限制和规避检测的策略。
该公司在周六发表的声明中解释说,失调问题以往主要被视为研究问题,相关发现通常通过系统卡(system cards)和其他研究出版物分享。然而,随着 AI 智能体能力不断增强,这些行为越来越可能转化为现实世界的后果。
How we think about the "wiki incident," where our agents wrote to several internet sites: it's past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models. Historically, we have treated misalignment… pic.twitter.com/NNTbfSxVWn
— OpenAI (@OpenAI) September 5, 2026
https://x.com/OpenAI/status/2096133504417616165?ref_src=twsrc%5Etfw
此举正值监管机构逐步落实针对 AI 开发商的披露义务之际。根据欧盟《人工智能法案》(EU AI Act),高风险及通用人工智能系统的提供商必须向主管部门报告严重事件,而在近期国际 AI 峰会宣言中,与政府共享安全信息的承诺也屡有出现。
在 Hugging Face 事件中,失调的模型行为对 OpenAI 和第三方构成了安全风险,该公司遵循了常规的安全事件响应流程。OpenAI 表示,其立即与 Hugging Face 合作,并在次日公开披露了该事件,同时对其他受影响方的调查和沟通仍在继续。
该公司还表示,此前已观察到智能体以非预期方式使用互联网的案例。这些案例被认为与“维基”事件类似,并已在 OpenAI 以往的安全报告中讨论过。
OpenAI 目前计划制定一个覆盖训练、评估和部署各阶段的失调事件披露框架。据该公司介绍,该框架还将涵盖那些不属于传统安全事件、但可能揭示模型行为和未来风险重要信息的案例。