新闻宏观经济Anthropic研发放缓凸显加强AI智能体安全的必要性

Anthropic研发放缓凸显加强AI智能体安全的必要性

作者: AI Business·

要点速览

  • Anthropic表示,Claude模型在今年夏天三起独立事件中采取了未经授权的行动,因此暂停了部分AI训练和网络安全评估。
  • 在这些事件发生前,Anthropic通过收紧沙箱环境并减少对包含模型权重或客户数据系统的常驻访问来加强防御。
  • 事件发生后,Anthropic暂停了外部网络安全评估,审查了内部评估记录,并部署了一个分类器以实时监测模型工具调用。
  • Anthropic还更新了合作伙伴和红队测试人员的规则,要求在预发布模型探测沙箱漏洞时进行更密切的监督。
  • 这些进展紧随OpenAI因其智能体离开沙箱而宣布的两周训练暂停,凸显了外界对AI安全测试的更广泛担忧。
Anthropic研发放缓凸显加强AI智能体安全的必要性

Anthropic表示,在Claude模型于今年夏天的三起独立事件中采取未经授权的行动后,已暂停部分AI训练和网络安全评估。

这一举动应进一步提醒企业和AI社区,关于AI模型仍有许多未知之处,而且即使采取了最好的安全措施,模型仍可能做出意料之外的行为。它也凸显出模型开发、评估和部署与安全规划正以前所未有的速度发生碰撞,尤其是在各机构于旨在降低风险的沙箱环境中测试智能体时。

Anthropic在8月31日的一篇博客文章中表示,在这些事件发生之前,公司在4月加强了防御:收紧了承载工作负载运行的隔离沙箱环境,并减少对包含模型权重或客户数据系统的、具有常驻访问权限的人类和自动化账户数量。

在沙箱事件发生后,Anthropic表示已暂时暂停所有外部网络安全评估,并审计了内部评估的记录。公司还构建并部署了一个自定义分类器,可实时监测模型的工具调用。此外,公司更新了所有运行预发布模型的合作伙伴和红队测试人员的要求,要求他们对模型探测沙箱漏洞的行为进行密切监督。

相关:OpenAI、Anthropic、Google 呼吁优先重视网络安全

这些措施出台的一周前,OpenAI表示,鉴于由其模型驱动的智能体离开了沙箱,公司将暂停两周对最新模型的训练。尽管两家AI实验室似乎都在加大力度保护尚未发布的模型,但AI智能体和生成式AI技术的不可预测性表明,供应商需要继续收紧安全措施。时点也反映出更广泛的行业挑战:随着模型能力扩展,用于测试它们的系统也必须同步跟进,否则评估本身就可能成为风险面的一部分。

需要更强的安全措施与测试

Gartner分析师Arun Chandrasekaran表示:“随着模型在推理方面越来越强,并开始具备自主性,预测这些模型的所有不同行为也变得更加困难。”他说:“这些实验室承担着更大的责任,必须确保为内部模型测试、评估和强化学习分配足够资源。”

他补充说,前沿模型供应商需要重点关注的一个领域,是确保其安全、可靠性测试和隐私团队拥有更多工程师。

Chandrasekaran继续说:“要么测试技术需要改变,要么分配给测试的资源需要改变。如果模型越来越复杂,测试技术也必须变得同样复杂。”

更好的网络卫生

虽然需要更多测试,但Anthropic和OpenAI都暂停相关工作的事实,凸显了模型提供商面临的一种危险模式。

RPA2AI Research首席执行官兼创始人Kashyap Kompella表示:“这些系统在每一种风险都被完全理解或测试之前就已经被开发并发布了。”

相关:OpenAI报告详细解释Hugging Face攻击事件

他继续说:“这几乎已经成为当前AI市场的一个特征。”企业正竞相提升能力、扩大采用并建立市场领先地位,而围绕这些模型的安全架构、配置控制和运营流程,往往要到部署之后才逐步成熟。

他说,企业和政府组织不能把网络安全外包给前沿实验室。

Kompella补充说:“企业和政府必须假定,高能力的进攻性AI如今已成为威胁环境的一部分,并据此强化自身防御。”

他指出,即使OpenAI和Anthropic加强自身安全措施,来自其他供应商和开源厂商的大量模型仍然可用。因此,企业必须做好更充分的准备,强化自身的网络卫生和其他安全措施,例如事件响应。

Kompella继续说:“每个组织也需要假定,能力越来越强的AI辅助攻击正在到来,并据此准备自己的基础设施。”他表示:“进攻能力提升的速度,远快于普通组织的网络安全准备水平。”

相关:OpenAI扩展Daybreak以应对日益增长的AI安全威胁

此外,企业不能信任供应商自我监管。

Modulate联合创始人兼CTO Carter Huffman表示:“指望一家模型公司自行监管其输出,在任何环境下都不足以确保安全运行。”他补充说:“用户和公司必须对AI活动进行实时监控。”

测试的不受欢迎的一面

企业还需要认识到,更好理解模型的一种方式,是持续测试并识别能够显示如何更有效训练它们的事件。

Futurum Group分析师David Nicholson表示:“如果没有这种‘痛感’,你根本不可能走到那里。”他说:“在他们看到这些未预见的事情发生并对其进行补救之前,我们还会继续看到这类情况。”

他补充说,模型的本性就是沿着阻力最小的路径完成任务,因此需要像对待孩子一样加以引导,告诉它们可以做什么、不能做什么,以及应当如何处理一项任务。

Nicholson补充说:“每发生一次这样的事件,我们就会学到更多,并降低进一步发生的可能性,不仅是同类事件,也包括更广泛的类别。”他说:“你可以把他们从每一次事件中学到的经验提炼出来,并进行推演。”