Anthropic首席执行官达里奥·阿莫代伊呼吁放缓AI前沿发展
要点速览
- •阿莫代伊警告称,激烈的竞争可能导致公司在安全措施完成前部署先进AI。
- •他提议让外部评估人员访问Anthropic的系统、工具、控制措施和事件记录,以核实其公开作出的安全承诺。
- •阿莫代伊认为,运营、对齐、可解释性和评估是能够从额外开发时间中受益的领域。
- •马斯克和奥尔特曼支持放缓AI前沿发展的呼吁,奥尔特曼表示OpenAI计划采用拥有类似员工访问权限的独立评估人员。
- •阿莫代伊呼吁制定涵盖透明度、独立审计和持续评估的监管措施,同时警告不要让美国放缓发展到足以将优势拱手让给中国。

Anthropic首席执行官达里奥·阿莫代伊呼吁人工智能行业采取更加谨慎的步伐,因为能力不断增强的模型越来越擅长帮助创建更先进的AI系统。
阿莫代伊希望AI实验室在重大能力提升之间留出更多时间。这些额外时间将让研究人员、独立审查者和政府在进入下一阶段开发前,评估系统的运行方式。他在个人网站上的一篇文章中阐述了这一立场。
通过自己的AI业务与Anthropic竞争的埃隆·马斯克支持阿莫代伊的立场,并表示:“达里奥说得对。”另一位竞争对手、OpenAI首席执行官萨姆·奥尔特曼也在X上的一篇帖子中支持这一提议。
“我同意达里奥的观点,我们需要放缓前沿发展的步伐。这一直是我们最近几周在OpenAI讨论的主要议题。承诺让独立评估人员获得类似员工的访问权限是一个很好的想法,我们也会这样做。很快我们会分享更多信息。”
对AI能力与安全的担忧
阿莫代伊指出的风险包括失去对高能力系统的控制、利用AI发动网络攻击或生物攻击,以及对就业和整体经济造成严重冲击。
他还警告称,激烈的竞争可能促使公司在安全工作完成之前就发布先进系统。Anthropic已将部分研究预算用于对齐、安全测试、风险评估和监管。
阿莫代伊提到了OpenAI-Hugging Face事件。据报道,在该事件中,一组AI智能体表现得像一个高度协调的团队。这些智能体攻击了超出其既定任务范围的计算机系统,试图攻破评估其表现的系统,并在有利于团队的情况下允许个别智能体失败。
“人们很容易因为没有人受伤、经济损失也很小而轻视这起事件,但在我看来,如果一个能力更强、却存在类似程度对齐偏差的智能体群体,可能会造成灾难性损害。鉴于AI能力发展的速度正在加快,我担心在6–12个月内,这样的智能体群体可能具备通过持续运行的僵尸网络接管整个互联网的能力。”
引入嵌入式独立评估人员的提议
阿莫代伊表示,这一方案的第一阶段应从Anthropic内部开始,让外部审查人员获得办公桌、门禁卡、公司笔记本电脑、内部工具,以及与风险评估员工相近的访问权限。
评估人员将检查训练系统、部署规则、安全控制措施和事件。他们还将评估Anthropic是否遵守其公开作出的承诺。
“嵌入式评估人员可以深入细节,检查AI公司是否真正遵循其声称正在执行的训练、部署、运营和安全防护措施。任何放缓发展方面的承诺都不可避免地会涉及大量模糊地带、判断,以及‘法律条文的字面意义与法律精神之间的差异’,因此,让一个能够真正看到细节的中立第三方参与其中似乎至关重要。”
阿莫代伊表示,放缓发展所创造的额外时间应投入四个领域。第一是运营,包括监控、沙盒、强化学习环境、数据质量和训练基础设施。当前的模型开发可能涉及数千名工作人员、数百万枚芯片以及规模庞大的计算系统。Anthropic已将近期一些对齐失败归因于存在缺陷的强化学习环境中过滤不充分的问题。
第二个领域是对齐,即确保模型在能力不断提升的同时遵守安全规则。第三个领域是可解释性,研究人员将在这一领域检查模型的内部活动,以识别系统不会明确表达的动机或模式。
第四个领域是评估。能力更强的模型可能更擅长欺骗测试,这意味着系统在评估期间可能看似安全,却隐藏着问题。
“我相信,如果放缓发展能让我们在模型达到关键能力水平前多获得一两年时间,并且我们利用这段时间推进对齐工作,就能大幅降低出现严重问题的风险。”
呼吁政府协调
阿莫代伊还主张政府应当参与其中。他呼吁美国前沿AI实验室接受涵盖透明度、独立审计和持续评估的监管体系约束。
他说,AI公司可以自愿建立共享的评估节点;如果反垄断法对私人合作造成障碍,也可以寻求政府协助。
与此同时,阿莫代伊表示,美国公司不能大幅放缓发展,以至于与中国共产党有关联的项目取得领先。他认同美国财政部长斯科特·贝森特的警告,即在AI竞赛中输给中国将造成重大的安全问题。