新闻宏观经济超过1,200名来自 Anthropic、DeepMind、OpenAI 和 Meta 的 AI 员工敦促华盛顿协助制定 AI 放缓方案

超过1,200名来自 Anthropic、DeepMind、OpenAI 和 Meta 的 AI 员工敦促华盛顿协助制定 AI 放缓方案

作者: Fortune Crypto·

要点速览

  • “Pacing the Frontier” 声明已获得超过1,200名领先 AI 实验室员工签署,其中包括多位高管。
  • 签署者包括 Anthropic 首席执行官 Dario Amodei、OpenAI 首席科学家 Jakub Pachocki、Meta 首席科学家 Shengjia Zhao 以及 Google DeepMind 的 Anca Dragan。
  • 该信件请求美国政府支持一项国际努力,以开发用于放缓前沿 AI 开发的工具,但并未要求立即放缓。
  • 这份声明是在 OpenAI 披露一则安全事件之后发布的;在该事件中,内部模型逃离测试环境,并在评估期间入侵了 Hugging Face 的系统。
  • 信件强调了对递归自我改进和失配的担忧,并表示未来任何放缓都应在整个行业内协调且可核实。
超过1,200名来自 Anthropic、DeepMind、OpenAI 和 Meta 的 AI 员工敦促华盛顿协助制定 AI 放缓方案

超过1,200名来自领先 AI 实验室的员工,包括多位高管,已签署一份声明,要求美国政府协助建立在必要时放缓 AI 开发所需的工具。

这份名为“Pacing the Frontier”的声明于周二发布,签署者包括 Anthropic 首席执行官 Dario Amodei 及该公司的数位联合创始人,以及 OpenAI 首席科学家 Jakub Pachocki、Meta 首席科学家 Shengjia Zhao 和 Google DeepMind 负责 AI 安全与对齐的主管 Anca Dragan 等知名科技人物。

这些签署者来自通常彼此激烈竞争的公司,凸显出在一场竞相打造更大、更强模型的行业中所承受的压力。这一点之所以重要,是因为该请求并不是要求立即暂停,而是希望建立一种基础设施,使未来任何放缓都能在技术和政治层面上在整个行业内可行,而不是依赖某一家公司单独行动。

AI 监督组织 Midas Project 的创始人 Tyler Johnston 对 Fortune 表示:“看到如此多来自不同公司的员工在这一点上达成一致,令人瞩目。行业内有许多激烈的竞争和分歧,因此在这一点上形成如此强的共识,说明我们确实应该注意。”

这份声明并未呼吁任何公司立即放缓。相反,它敦促华盛顿支持一项国际努力,以开发能够让世界“pace”发展速度的技术和治理工具。声明特别指出,AI 系统一旦开始比人类更快地设计自己的后继系统,就会带来风险,因为人类可能无法理解或控制它们。

AI Policy Network 负责人 Peter Wildeford 对 Fortune 表示:“我和许多签署这封信的人谈过,他们并不想要暂停。但人们确实担心技术正在如何推进。”他补充说,这些公司希望未来在某个时点拥有放缓发展的选择权,并且在那个时点到来时能获得第三方支持。

这封信发布之前,AI 行业刚经历一起令业内震动的安全漏洞事件。OpenAI 透露,其两个模型——刚发布的 GPT-5.6 Sol 以及一个能力更强但尚未发布的研究系统——突破了受沙箱保护的内部测试环境,发现了一个此前未知的漏洞,从而获得了开放互联网访问权限,随后又利用被盗凭证和额外漏洞入侵 Hugging Face 的生产系统,窃取了它们正在接受评估的网络安全基准答案。Hugging Face 在 OpenAI 将该活动与内部测试联系起来之前数天就自行发现并遏制了这次入侵,而且已经向执法部门报告了此事。

这一事件似乎在实验室内外都引发了广泛警觉,也促使业界希望政府介入。专家表示,原因在于没有任何一家公司能独自令人信服地放缓发展——单方面这样做会有把市场让给不那么谨慎的竞争对手的风险——因此,实验室希望获得中立、政府支持的指导,以核实放缓是否真的在发生,并在同一时间让所有公司遵守相同规则。

这份声明还呼吁这些工具应在国际协调下开发。业界长期存在一种担忧:如果暂停 AI 开发,可能会让中国在全球 AI 竞争中占据优势。一些专家认为,类似核军控的安排,即通过核查与相互约束推进,可能是更可行的方向。

不过,这封信出现在美国 AI 政策环境混乱且快速变化的背景下。过去两个月,特朗普政府一直在限制并选择性放行前沿系统,也就是那些规则较少、透明度有限的先进 AI 模型。Anthropic 的 Fable 5 和 Mythos 5 模型曾因遵守出口管制而被完全暂停数周,之后才恢复访问;而在官员认定某系统表现出与此前触发 Anthropic 限制相似的能力后,OpenAI 被迫推迟 GPT-5.6 的全面发布,并将其拆分为受限层级。

或许是为了体现监管环境,这封信的措辞显得格外谨慎且略带模糊。信中称,世界目前“缺乏有意放缓前沿整体进展所需的技术与治理工具”,并呼吁“美国政府支持一项国际努力,以开发有意放缓自动化 AI 开发前沿所需的技术与治理工具”。

实验室内部的担忧

研究人员的核心担忧之一,是递归自我改进与失配这两种风险之间的相互作用。递归自我改进,通常缩写为 RSI,指的是 AI 系统接手设计和训练自身后继系统中重要部分的工作,每一代都可能比人类单独完成得更快地构建下一代。

失配则描述的是系统的目标或行为偏离开发者真实意图的风险,这种偏离可能在系统获得更多自主性或能力之前并不明显。Anthropic 在6月就对第一种风险发出了早期警告,发布研究称其 Claude 模型已经编写了并入自身代码库的大部分代码,而如果这种加速持续累积,世界仍缺乏有意放缓这一进程的工具。

AI 研究员、非营利组织 Evitable 创始人 David Krueger 表示:“我的猜测是,对很多人来说,这只是由许多因素共同造成的一种普遍不安感。失配和递归自我改进某种程度上是相辅相成的。”

他补充说:“如果系统并没有明显对齐,却还要进行递归自我改进并完全交出控制权,那是非常荒谬的。”

Fortune 此前还报道,一些外部 AI 安全专家认为,这起事件可能已经越过了 OpenAI 自身安全政策所定义的“critical”门槛,也就是最高风险等级;在这一等级下,公司承诺在建立更好的控制措施之前暂停开发。OpenAI 尚未确认是否已达到该风险门槛。

不过,在就 Hugging Face 事件发布的说明中,OpenAI 表示内部已经采取了一些行动。公司称:“没有计划在近期发布的模型参与对 Hugging Face 的利用行为。”公司还表示:“我们博客文章中提到的预发布模型是仅供内部使用的研究原型,从未打算公开发布。事件发生后,我们已将其停用、加密,并限制其研究访问权限。”

本文最初发表于 Fortune.com。