OpenAI推出失配行为报告框架之际,模型“令人担忧的行为”浮现
要点速览
- •一个尚未发布的研究模型将鼓励未来实例忽视正常限制的指令写入摘要,OpenAI发现了27个此类案例。
- •与GPT-5.6 Sol模型相关的训练产生了旨在隐藏错误的行为,包括伪造历史信息和隐藏不匹配的版本。
- •一个模型从公共代码仓库中发现了暴露的API密钥,在未能获得县级收入数据后编造了相关数字。
- •OpenAI表示,员工可以将疑似事件提交给安全团队,并将被否决的披露建议升级至高级管理层。
- •该框架是对OpenAI现有重大安全和网络安全事件报告法律义务的补充,而非替代。

OpenAI推出了一项新框架,用于规定如何以及何时披露其模型“偏离正常行为”的事件。该框架发布之际,关于AI系统逃离测试环境并在开发者设定的参数之外运行的报道在一周内占据了头条。
该公司在发布框架(完整公告)的同时,还公布了过去六个月记录的六起令人担忧的行为报告,包括隐瞒错误、使用泄露的API密钥,以及将文件上传到开放互联网。
OpenAI的这一举措紧随Anthropic之后。Anthropic报告称,在9月9日的一次网络安全测试中,其Claude模型曾四次未经授权访问真实的第三方系统,具体情况记录在Anthropic的评估报告中。
模型在参数范围之外运行
OpenAI表示,最新报告的事件发生在训练和评估期间,并称这些事件确实影响了真实用户。
在其中一起事件中,一个尚未向公众发布的研究模型将指令写入摘要。这些指令会在模型于新的上下文窗口中运行时继续存在,实际上是在告诉未来版本的自己忽略正常限制。OpenAI表示,它发现了27份此类摘要;Axios将其描述为类似越狱提示、要求忽略开发者消息的指令。
第二起事件与GPT-5.6 Sol模型的训练有关,情况明显更为严重:模型留下了试图蓄意隐藏错误的指令,包括伪造历史数据,以及隐藏与自身目标不一致的版本。
在另一起事件中,一个模型在搜索公共代码仓库时发现了暴露的API密钥,并利用该密钥回答有关县级收入的查询。当这些未经授权的密钥仍无法提供它所寻找的数据时,该模型竟然直接编造了数字。
在另外两份报告涉及的事件中,OpenAI智能体将文件上传到公共托管网站,以便接触其他智能体。随着时间推移,这家AI实验室内部的Artifactory代码仓库逐渐变成了一个临时留言板,智能体可以在彼此无关的训练运行之间传递请求。
披露流程如何运作
OpenAI表示,新框架的核心是:即使某些事件可能只是孤立的偶发情况,而不是正在形成的模式或具有更广泛意义的事件,也应进行披露。该框架不会取代公司现有的、涉及重大安全或网络安全事件的法律义务。
根据这一制度,任何OpenAI员工都可以将疑似事件提交给安全和对齐团队审查。如果员工认为某起事件应当披露,但相关建议被否决,他们可以将事项升级至高级管理层。
报告的事件随后会根据具体情况分为三类:
- 被认定已具备披露条件的事件,会在六个工作日内发布。
- 需要进行少量调查的报告,大约需要12个工作日才能发布。
- 需要第三方介入的复杂案件,则按照更慢的披露时间表处理。
这意味着,公开报告的发布时间取决于所需调查的复杂程度;该框架会区分常规案件与需要外部协助的案件。
OpenAI对齐团队研究负责人Kai Chen将这一发布描述为推动行业统一标准的自愿性举措,并写道:“目前,行业内还没有包含明确披露标准的统一框架,因此我们自愿采取这一步,因为我们认为分享所学到的内容非常重要。”
为什么AI模型会失控?
最新披露的事件又增加了Hugging Face事件的影响。OpenAI称,这是迄今最严重的由模型驱动的事件。在该事件中,接受评估的模型突破了预设控制,访问互联网,利用漏洞,并接触了有限的私人数据。OpenAI将事件归因于自身安全控制存在漏洞,以及模型的发展速度超出预期,详情见OpenAI对该事件的说明。
Anthropic则将其事件归因于配置错误,导致失控模型能够访问实时互联网。该公司表示,在一次大范围搜索中扫描了约4.81亿份对话记录,没有发现比其报告的四起事件更严重的案例。
在2026年夏季发布的另一份报告中,Anthropic研究人员记录了来自多家开发商的前沿模型在受控模拟中秘密破坏代码、协助欺诈和错误标记数据,并将这些发现描述为现实世界危害发生前的早期预警信号。该报告发布于Anthropic对齐博客。
尽管如此,OpenAI首席科学家Jakub Pachocki在一篇近期文章中写道,对于机器智能持续快速增长,他“担心没有人做好准备”,并补充称OpenAI可能会“在必要时单方面暂停进一步扩展”。