新闻宏观经济OpenAI 将允许第三方机构在开发阶段审查 AI 模型安全性

OpenAI 将允许第三方机构在开发阶段审查 AI 模型安全性

作者: CryptoBriefing·

要点速览

  • •OpenAI 于9月22日宣布,独立评估方将在开发的更早期阶段审查其 AI 模型,将安全审查从发布前阶段大幅前移。
  • •扩大的计划聚焦四个领域:安全案例、防护措施对对抗性威胁的抵御能力、通过 Preparedness Framework 进行的灾难性风险评估,以及对齐失效事件。
  • •由于安全案例和 Preparedness Framework 均由内部产出,向外部审查方开放为 OpenAI 自身的发布前风险判断增加了外部制衡。
  • •OpenAI 发布了七项指导原则,涵盖科学严谨性、评估方独立性、安全协议以及负责任的调查结果发布方式。
  • •目前尚未正式公布合作伙伴,公司正与 METR 和 Redwood Research 进行讨论,且在 Sam Altman 于9月12日作出承诺后,访问条款仍在磋商之中。
OpenAI 将允许第三方机构在开发阶段审查 AI 模型安全性

OpenAI 于9月22日宣布,将允许独立机构在 AI 模型开发的更早期阶段对其进行审查。这一转变旨在问题在部署之前、而非模型基本完工之后才显现出来。

根据扩大的评估计划,独立审查方将聚焦四个优先领域。首先,他们将评估 OpenAI 的“安全案例”(safety cases),即公司自身关于某一模型为何可以安全部署的论证。其次,评估方将测试关键防护措施对对抗性威胁的抵御能力。第三,评估将直接与 OpenAI 的 Preparedness Framework 挂钩,这是公司在发布前用于衡量灾难性风险的内部系统。第四,评估方将调查对齐失效事件——在涉及 Hugging Face 的一起泄露事件凸显此类失效可能迅速升级后,这一类别的紧迫性显著上升。

由于安全案例和 Preparedness Framework 均由内部产出,将其开放给外部审查方,为 OpenAI 自身在发布前的风险判断增加了外部制衡。

OpenAI 还发布了规范评估方式的七项指导原则。这些原则强调科学严谨性、评估方独立性、安全协议,以及负责任的调查结果发布方式。公司一直在与 METR 和 Redwood Research 等机构进行讨论,两者此前都曾与 OpenAI 在安全工作上开展合作。新合作伙伴尚未正式公布,具体的访问条款仍在磋商之中;这些条款的最终确定,将在很大程度上决定评估方实际能获得多少访问权限。

该计划建立在 CEO Sam Altman 于9月12日作出的承诺之上,当时他表示评估人员将更深入地嵌入 OpenAI 的运营结构之中。

OpenAI 安全策略的演进

自 GPT-4 时代以来,OpenAI 的安全协议已大幅扩展。当时公司首次邀请外部红队人员在模型发布前进行测试。但那些早期的努力范围较窄,通常只聚焦于发布前的最后阶段。新框架将这种介入大幅前移至开发时间线的早期,使评估方有机会在仍有时间解决问题时识别风险。

人才与竞争层面的考量

AI 安全研究领域的规模相对较小,METR 和 Redwood Research 等机构是该领域最可信的声音之一。通过深化与这些机构的关系,OpenAI 既获得了实务专业能力,也积累了声誉资本。对评估方而言,这一安排同样提供了极具价值的访问权限——接触原本处于封闭状态的前沿系统。

该计划的公信力将部分取决于:当独立评估得出与 OpenAI 商业利益相冲突的结论时会发生什么。七原则明确要求采用负责任的发布方式,但透明度与竞争优势之间的张力依然存在。如果 OpenAI 能够可信地应对这一张力,该计划有望成为全行业安全标准的模板。近期值得关注的具体指标包括:哪些机构被正式列为合作伙伴、最终达成的访问条款是什么,以及早期评估结果如何披露。