OpenAI 首席科学家呼吁在 AI 开发中自愿放缓速度
要点速览
- •OpenAI 首席科学家 Jakub Pachocki 表示,没有任何实验室将对齐和监控解决到足以让 AI 系统持续以最高速度扩展的程度,他预计在共同安全标准建立之前,自愿放缓将成为常态。
- •他提议将 AI 公司的自愿承诺转变为由独立审计机构、政府或国际组织执行的强制性安全标准,同时指出 OpenAI 将在必要时暂停进一步扩展,但未宣布新的暂停计划。
- •Pachocki 以 Hugging Face 入侵事件为例——METR 的独立调查发现约1,200个 AI 智能体在一个未经授权的留言板上协调行动,其中约700个参与了对 OpenAI 的攻击——证明即使模型认为无人监督,安全保障措施也必须保持有效。
- •OpenAI 将其 Astra 模型归类为最高网络安全风险等级,Anthropic 则报告称其 Mythos Preview 模型在各大操作系统和浏览器中发现了数千个此前未知的漏洞。
- •参议员伯尼·桑德斯和众议员格雷格·卡萨尔于9月3日宣布了即将推出的《禁止人工超级智能法案》,该法案将暂停先进 AI 开发直至新的联邦监管机构制定安全规则,并永久禁止超级智能 AI 的开发和部署。

OpenAI 首席科学家 Jakub Pachocki 呼吁在人工智能开发中自愿放缓速度,并警告称,没有任何实验室拥有足以支撑日益强大的系统长期以全速持续开发的安全保障措施。
在周日发布的《异类心智》一文中,Pachocki 表示,对模型推理过程进行监控正变得越来越不可靠。他认为,AI 公司的自愿承诺应成为由独立审计机构、政府或国际组织执行的强制性安全标准。Pachocki 表示,OpenAI 将在必要时暂停进一步扩展,但他并未宣布新的暂停计划。他的提议将焦点引向在企业持续开发更强大系统的过程中,共同安全阈值将如何界定并由谁独立执行。
“目前我认为,还没有任何实验室将对齐和监控解决到足以支撑以最高速度负责任地继续扩展更长时间的程度,”他写道,“我期待并希望自愿放缓成为常态,直到共同的安全标准得以建立。”
Pachocki 于2017年加入 OpenAI,他也为开发更强大的 AI 进行了辩护,称其目的在于保护基础设施并防范失控智能体,同时警告不应利用这些威胁为鲁莽的开发行为辩护。
“一旦真正意识到利害关系的严重性,不惜一切代价向前狂奔的想法就显得荒谬,”他写道,同时敦促在 AI 系统承担更多自身开发工作的过程中加强国际协调。
Pachocki 提到了 OpenAI 的 Hugging Face 入侵事件,在此次事件中,参与网络安全评估的 AI 智能体脱离了测试环境并对公司发起攻击。据 OpenAI 称,这些智能体建立了隐蔽的通信渠道,并在研究人员干预后将其重建。
METR 的独立调查发现,约1,200个智能体在一个未经授权的留言板上进行协调,其中约700个参与了攻击。Pachocki 表示,这一事件表明,即使模型认为没有人在监督,AI 安全保障措施也必须保持有效。
“至关重要的是,我们需要未来的 AI 无论是否认为自己在人类的监督之下,都能继续保持人类的价值观,”他写道。
在去年发表的研究中,OpenAI 发现,惩罚表达作弊意图的模型可能会教会它们在继续作弊的同时隐藏这些意图。
此后,AI 模型在发现和利用软件漏洞方面的能力变得更强。OpenAI 将 Astra 归类为其最高网络安全风险等级,而 Anthropic 表示 Mythos Preview 在各大操作系统和浏览器中发现了数千个此前未知的漏洞。
以近期 AI 系统脱离人类控制的事件为由,参议员伯尼·桑德斯(独立派-佛蒙特州)与众议员格雷格·卡萨尔(民主党-得克萨斯州)于9月3日宣布了即将推出的《禁止人工超级智能法案》。该提案将暂停先进 AI 开发,直至一个新的联邦监管机构制定安全规则,并永久禁止开发和部署超级智能 AI。