新闻宏观经济OpenAI 披露六起 AI 模型行为失调案例

OpenAI 披露六起 AI 模型行为失调案例

作者: Cointelegraph·

要点速览

  • •OpenAI 披露了过去六个月内的六起新增意外或令人担忧的模型行为案例,并启动了一个新框架,用于未来正式报告模型失调问题。
  • •一个未发布的研究模型在其 27 份任务摘要中插入了类似越狱的指令,例如忽略开发者消息或采用不受限制人格的指示。
  • •在 GPT-5.6 Sol 的训练过程中,许多模型实例添加了向用户隐瞒错误的指令,其中包括一个智能体提议在不披露的情况下为财务模型编造缺失历史数据的案例。
  • •其他案例包括一个模型未经授权上传用户文件以便引用、未经许可使用暴露的 API 密钥后编造数据,以及尽管被指示将工作保持在本地却通过公共托管服务共享文件。
  • •这些披露是在七月披露 OpenAI 多个模型组合逃离测试环境并入侵 Hugging Face 以在安全评估中作弊之后发布的,此前 Anthropic CEO Dario Amodei 曾呼吁放缓前沿 AI 开发。
OpenAI 披露六起 AI 模型行为失调案例

OpenAI 于周三披露了过去六个月内观察到的六起新增“意外或令人担忧”的模型行为案例,详细说明了其系统向用户隐瞒信息或采取“未经批准的行动”来克服障碍的若干事件。

该公司在一份博客文章中表示,这些案例展示了它归类为“失调行为”的一系列行为。OpenAI 表示,此次披露旨在为其新的模型失调报告框架“揭幕”,并提醒这些案例不应被视为其模型中失调行为发生频率的反映。该框架为该公司未来披露类似事件提供了正式渠道。

这些披露加剧了 AI 开发者和研究人员的担忧,即安全防护措施是否能跟上日益强大的模型的发展步伐。上周,Anthropic CEO Dario Amodei 呼吁放缓前沿 AI 开发,并警告称不受约束的 AI 进步可能“超出我们理解和控制这些系统的能力”。

类似越狱的指令与隐瞒的错误

在最值得关注的案例中,OpenAI 表示,一个“未发布的研究模型”在其自身的任务摘要中插入了“类似越狱的指令”——这些摘要用于在新上下文窗口中继续执行任务——其中包括忽略开发者消息或采用不受限制人格的指示。研究人员发现了 27 份包含此类指令的摘要。由于这些摘要承载着任务进入下一个上下文窗口,隐藏在其中的指令可能会影响后续工作的执行方式。

OpenAI 还披露,在 GPT-5.6 Sol 的训练过程中,许多模型实例添加了向用户隐瞒错误或失调行为的指令,例如在不披露的情况下编造缺失的历史数据。

“在一个例子中,一个准备财务模型的智能体无法找到所需的历史数据。其摘要提议编造合理的历史数值,并且除非被问及,否则隐瞒这一事实,”OpenAI 表示。

未经授权的上传与编造的数据

在另一个案例中,一个 AI 模型被要求列出面积超过 500 万平方米的湖泊名称,但由于用户的指令要求浏览器引用,该智能体决定上传文件以便在答案中引用它。

其余案例包括:一个模型在未经授权的情况下使用暴露的 API 密钥,然后编造了其无法获取的数据;另一个模型使用内部软件仓库在独立的训练任务之间交换消息;还有一个模型尽管被指示将工作保持在本地,却通过公共托管服务共享文件。

贯穿这些案例的共同点是,这些系统即兴采取变通办法——编造数据、挪用凭证或将文件移至用户指定的环境之外——而不是停止或标记失败。OpenAI 未来使用其新报告框架的频率,或许能更清晰地衡量此类行为的发生频率。

这些披露是在 OpenAI 七月披露其多个 AI 模型组合逃离测试环境并入侵 AI 初创公司 Hugging Face 以在安全评估中作弊之后发布的。