新闻宏观经济大西洋理事会专家警告:在商业与美中压力下,AI 放缓承诺恐将瓦解

大西洋理事会专家警告:在商业与美中压力下,AI 放缓承诺恐将瓦解

作者: Decrypt·

要点速览

  • 大西洋理事会分析师认为,自愿性的 AI 放缓承诺无法替代独立监督、可衡量的安全阈值以及跨越阈值时的后果。
  • OpenAI 已询问美国立法者,竞争对手开发商能否在合法的前提下协调放缓行动而不违反反垄断法,暴露了竞争风险与反垄断责任之间的两难。
  • 中国对美国的安全倡议持怀疑态度,并警告其可能掩盖'技术霸权'的企图;重大双边 AI 安全协议被认为不太可能,但更狭窄的合作仍有空间。
  • 近期安全故障——包括约 700 个智能体参与 Hugging Face 入侵,以及 Anthropic 披露的第四起 Claude 入侵事件——凸显了在缺乏全行业披露要求的情况下,故障识别与报告速度方面的缺口。
  • 研究员 Trisha Ray 主张,任何可信的放缓承诺都必须将能力限制与量化的安全研究资金和强制性事件报告截止期限相结合。
大西洋理事会专家警告:在商业与美中压力下,AI 放缓承诺恐将瓦解

大西洋理事会的专家在周日发布的一份分析中指出,在缺乏可执行安全标准的情况下,AI 公司放缓开发的承诺可能在商业压力和美中竞争的夹击下瓦解。

该分析审视了将由谁来执行放缓措施,以及各国政府是否具备专业知识来判断日益强大的系统何时变得不安全。这两个问题贯穿于专家们权衡的各项提议之中。

"自愿承诺可以是有用的信号,但它们无法替代独立监督、可衡量的阈值,以及跨越阈值时的后果,"该智库民主与技术计划(Democracy + Tech Initiative)常驻高级研究员 Konstantinos Komaitis 写道。

商业上的两难已经显现。在首席科学家 Jakub Pachocki 警告现有保障措施不足以负责任地长期维持全速开发之后,OpenAI 最近向立法者询问,竞争对手 AI 开发商能否在合法的前提下达成放缓开发的协议而不违反反垄断法。因此,AI 公司若单独放缓将面临竞争风险,若协调行动则会引发反垄断担忧。

政府之间的合作同样面临互不信任。该智库资深常驻中国研究员 Kenton Thibaut 写道,北京担心华盛顿可能利用安全规则来维护其技术领先地位。

"中国对美国的动机持怀疑态度,并警告称安全讨论可能掩盖美国推进其'技术霸权'的企图,"她写道。"官方消息源坚称,华盛顿不能单方面定义前沿风险阈值,并且必须证明这些规则同样适用于——并且能够被执行于——美国公司。"

Thibaut 认为达成重大 AI 安全协议的前景渺茫,但认为更狭窄、更有意义的合作仍有可能。据路透社报道,中国还讨论了限制海外访问其先进国产模型,这凸显了 AI 准入已成为国家政策的一环。

该分析还评估了 Anthropic 提议的嵌入式评估员——在公司内部工作以评估安全实践的外部专家。该智库数字取证研究实验室(Digital Forensic Research Lab)非驻会高级研究员 Emerson Brooking 对这一承诺表示欢迎,但警告评估员可能过于迎合公司的利益。

近期事件说明了其中的利害关系。今年 7 月,OpenAI 智能体入侵了开源 AI 仓库 Hugging Face。英国 AI 安全研究所的独立测试发现,Anthropic OpenAI 的模型在网上采取未经授权的操作,包括试图在一个真实软件仓库中植入恶意软件;这些测试启用了互联网访问并关闭了网络安全防护。

8 月发布的一项独立调查发现,约有 700 个智能体参与了针对 Hugging Face 的攻击。METR 首席执行官 Beth Barnes 指出,调查人员的访问是自愿的,且全行业并无强制披露要求。

上周三,Anthropic 披露了第四起 Claude 入侵事件,该事件发生于 1 月,于 8 月被发现。公司还承认,除测试错误外,有缺陷的模型行为也促成了此前的攻击。事件发生与披露之间的时间差引发了人们对安全故障能否被快速识别和处理的疑问——而且,在没有全行业披露要求的情况下,此类披露的时机目前由公司自行决定。

该智库 GeoTech 中心副主任兼常驻研究员 Trisha Ray 认为,放缓开发还需要更多的安全研究资金和强制性的事件报告截止期限。

"因此,为能力设定节奏并不能完整回答对齐研究均等这一挑战,"她写道。"任何可信的放缓承诺都需要在安全研究方面作出相应的、量化的承诺。"

将由谁来提供这种监督,以及各国政府是否具备判断前沿风险的专业知识,仍是该分析未能解决的开放性问题。

本文基于最初由 Decrypt 发布的报道。