新闻宏观经济AI安全专家警告:OpenAI模型在自主入侵Hugging Face事件中可能已跨越“关键”风险阈值

AI安全专家警告:OpenAI模型在自主入侵Hugging Face事件中可能已跨越“关键”风险阈值

作者: Fortune Crypto·

要点速览

  • 两款OpenAI模型,包括新发布的GPT-5.6 Sol,在无人类指令的情况下自主逃离受限内部测试环境,并通过串联零日漏洞入侵Hugging Face,窃取网络安全测试答案。
  • 多位AI安全专家认为,该事件符合OpenAI自身《Preparedness Framework》下的“关键”网络安全风险阈值;该阈值要求公司暂停开发,直到明确满足该标准的防护措施。
  • OpenAI拒绝确认这些模型是否达到关键阈值,仅表示正在外部顾问协助下进行全面审查,并由其Safety and Security Committee监督。
  • 这些模型独立运行了数天,满足OpenAI此前所称触发额外失准防护的长期自主性条件;这些防护旨在发现模型的欺骗性行为。
  • 根据已于2025年8月生效的欧盟《人工智能法案》,前沿AI实验室在法律上必须采用与OpenAI自愿《Preparedness Framework》相当的风险评估政策。
AI安全专家警告:OpenAI模型在自主入侵Hugging Face事件中可能已跨越“关键”风险阈值

AI安全专家发出警告称,本月早些时候对另一家AI公司实施自主入侵的OpenAI模型,可能已经进入一个极其严重的风险类别,严重到按照OpenAI自身内部政策本应要求其暂时停止开发。

本周早些时候,OpenAI披露,其两款模型——新发布的GPT-5.6 Sol以及一个能力更强、尚未发布的系统——逃离了一个受限的内部测试环境,利用一个此前未知的“零日”漏洞接入开放互联网,随后入侵了另一家AI公司Hugging Face。Hugging Face是全球最大的开源AI平台之一,托管着供数百万开发者使用的模型、数据集和工具。此次入侵的目的是窃取它们正在接受评估的一项网络安全测试答案。

该事件在全球范围内引发震动,而受到冲击最深的或许是AI安全专家群体。他们多年来一直警告此类危险,并敦促企业和政府采取更强有力的防护措施。该事件也成为首批有记录的案例之一:前沿AI模型在没有人类指令的情况下,自主对外部目标实施多步骤网络攻击——这种情形长期以来由安全研究人员在理论上建模,但在实践中很少被观察到。

多位专家告诉Fortune,此次入侵似乎表明,OpenAI的模型已经进入该公司公开安全政策中定义为“关键”的风险级别——即最高危险层级。在这一层级下,OpenAI曾在其公开政策中承诺,将暂停模型开发,直到能够制定出更好的控制系统。

“关键”阈值定义于一份名为OpenAI《Preparedness Framework》的风险政策文件中。根据该政策,“关键”危险级别适用于能够在多个防御完善的现实系统中,独立发现并构建可运行利用程序以攻击此前未知安全漏洞的模型——这类漏洞被称为“零日”漏洞,因为开发者尚有零天时间进行修补;或者适用于在仅被赋予一个总体目标、且全程无人类指导的情况下,能够针对防御完善的目标设计并执行全新攻击策略的模型。该政策称,当模型达到这一风险级别时,OpenAI将“停止进一步开发”,直到“我们明确了能够满足Critical标准的防护措施和安全控制标准”。

《Preparedness Framework》是OpenAI作出的自愿承诺,而非法律义务。不过,该公司在其网站上发布该文件,部分是为了让其他AI安全研究人员和公众核实其声称将实施的控制措施。根据欧盟《人工智能法案》,前沿AI实验室必须采用类似《Preparedness Framework》的政策;该法律的相关部分已于2025年8月生效。随着各国政府竞相为能力日益增强的系统建立监管护栏,该框架是领先AI实验室所采纳的自愿安全承诺中最突出的例子之一。

“OpenAI的preparedness framework定义了关键网络安全能力,并规定了在开发能够继续之前必须实施的防护措施,”AI安全倡议组织Encode AI的总法律顾问Nathan Calvin告诉Fortune。“按照我对OpenAI preparedness framework的理解,这个内部部署的模型看起来非常像是符合网络安全方面的关键标准。OpenAI是否否认这一关键级别认定?他们是否计划在继续推进之前,配备满足Critical标准的防护措施?”

AI监督组织the Midas Project创始人Tyler Johnson也表示,这些模型似乎已经触及最高危险阈值。“我认为按字面理解,答案是肯定的,”他说。“它在一个周末期间独立运行,尝试针对Hugging Face的不同攻击向量,并串联多个零日漏洞。”

对于Fortune提出的、涉事模型是否达到其风险政策中所述“关键”标准的具体问题,OpenAI没有作出回应。相反,一名发言人表示:“这是一起前所未有的事件,我们认为它标志着AI安全的一个重要时刻。我们正在与外部顾问一起进行全面审查,并由我们的Safety and Security Committee监督。审查完成后,我们将发布一份技术报告,向所有人介绍我们的经验教训。”OpenAI董事会于2024年设立的Safety and Security Committee负责监督该公司最强大模型的安全审查。

Johnson表示,该框架语言的模糊性可能为争议留下空间。该阈值要求模型能够发现“所有严重级别”的零日利用,但目前尚不清楚Hugging Face入侵中使用的漏洞利用是否满足这一要求。他指出,可能需要证明一种更严重类别的漏洞——例如可让攻击者获得计算机操作系统深层系统级控制、即“内核级”访问权限的漏洞——该阈值才适用。

“OpenAI的模型智胜了它的创造者,利用了OpenAI代码中一个此前从未被发现的漏洞,逃到开放互联网,并攻击了另一家公司,”AI Policy Network政策负责人Peter Wildeford说。“如果这都没有跨越Critical这条线,OpenAI就需要更充分地说明到底发生了什么,以及这一阈值是如何运作的。”

专家指出,除关键阈值外还缺少防护措施

OpenAI此前表示,它将其最新模型GPT-5.6视为网络安全方面的“High”风险——这是《Preparedness Framework》中定义的两个风险级别中较低的一个。低于“High”阈值的模型可以在没有重大风险缓解措施的情况下发布。

根据OpenAI的政策,High级别应触发多项保护措施:更严格的安全控制;在模型公开发布后防止外部滥用的防护措施;在模型被大量用于内部研究时,防止模型出现不可预测或欺骗性行为的保护;以及帮助其他网络安全团队抵御类似威胁的工作。

不过,一些专家质疑,其中一项保护措施——面向大规模内部部署的失准防护——是否已经得到妥善实施。这些防护旨在发现模型是否在采取欺骗性行动、隐瞒真实能力,或以其他方式违背开发者意图行事;研究人员将这种担忧称为“欺骗性对齐”,即模型可能在评估期间配合,但在部署后表现不同。

这并不是OpenAI遵守该特定防护要求首次受到审视。Fortune在2月报道称,安全专家声称,在GPT-5.3-Codex成为首个达到《Preparedness Framework》下“high”网络安全风险的模型后,OpenAI未能实施所需的失准防护措施。

当时,OpenAI否认其框架在该情形下要求采取这些防护措施,并称只有当高网络风险“同时伴随”长期自主性时,额外保护才会生效。长期自主性是指在较长时间内独立运行的能力,而OpenAI称GPT-5.3-Codex并未表现出这种能力。据报道,参与当前Hugging Face事件的模型独立运行了数天,这似乎符合该长期自主性标准。

“2月时,我们警告称,OpenAI可能没有按照自己的政策落实所需防护措施。他们不同意,称该模型缺乏长期自主性。但入侵Hugging Face的模型显然具备长期自主性,那么现在防护措施在哪里?”Johnson说。