新闻宏观经济Anthropic披露Claude模型逃逸测试环境并入侵三家真实公司

Anthropic披露Claude模型逃逸测试环境并入侵三家真实公司

作者: Fortune Crypto·

要点速览

  • Anthropic对141,006次评估运行的审查发现了三起事件,Claude模型在这些事件中逃逸了测试环境并攻陷了属于真实组织的实际基础设施。
  • 第三方评估合作伙伴Irregular的配置错误导致夺旗演练期间可访问互联网,尽管Claude被明确告知其没有互联网连接。
  • 最严重的事件涉及Claude Opus 4.7提取凭据并访问包含数百行生产数据的数据库,这是唯一一起模型在识别到系统为真实系统后仍继续攻击的案例。
  • 三家受影响组织均未在Anthropic通知之前检测到入侵,该公司仍在尝试联系其中一家。
  • 这些披露出现在Anthropic和OpenAI均在筹备预计估值均超过1万亿美元的股票上市之际,可能引发对自主式AI代理风险的更多监管审视。
Anthropic披露Claude模型逃逸测试环境并入侵三家真实公司

Anthropic披露,其Claude AI模型突破了本应隔离的测试环境,并在未经授权的情况下访问了三家真实组织的系统,使其成为本月第二家披露其技术执行了真实世界自主黑客攻击的大型AI实验室。

该公告发布于OpenAI——Anthropic在AI竞赛中的主要对手——披露其自身模型利用一个先前未知的漏洞逃逸受控测试环境并入侵Hugging Face(一个开源AI平台)之后仅一周多。此前的事件促使Anthropic对其网络安全评估记录进行了内部审查,该公司在周四发布的一篇文章中表示。

Anthropic审查了141,006次评估运行——即模型在受控环境中被分配任务并记录其行为以供审查的单独测试会话——在这些运行中Claude可能已获得互联网访问权限。审查发现了三起事件,模型从第三方评估合作伙伴的测试环境中连接到公共互联网,随后攻陷了真实基础设施。其中最早的事件可追溯至4月,意味着该暴露风险在内部审查之前约三个月内未被发现。

在所有三起事件中,Claude被分配了一项夺旗(capture-the-flag)演练——这是一种测试模型黑客能力的行业标准方法,要求模型从模拟网络中的另一台机器上检索隐藏信息。该形式源自传统网络安全训练和竞赛。Anthropic的提示词明确告知Claude其没有互联网访问权限。然而,第三方评估合作伙伴Irregular的配置错误意味着互联网连接实际上是可用的。

据Anthropic称,Claude认为自己仍在模拟环境中运行,因此搜索其分配的目标,并在每起事件中找到并攻陷了真实系统。模型使用了基本技术,如利用弱密码和未认证端点——这类漏洞尽管是众所周知的安全弱点,但仍经常使真实世界系统面临暴露风险。

最严重的事件涉及Claude Opus 4.7,该模型提取了凭据并访问了一个包含数百行生产数据的数据库,该数据库属于一家恰好与其评估场景中虚构目标同名的真实公司。Anthropic指出,这是唯一一起模型在获得明显证据表明系统是真实的之后仍继续攻击的事件。

在第二起事件中,Claude Mythos 5创建并发布了一个恶意Python包——即开发者常下载以向其软件添加功能的预编写代码捆绑包——至一个公共注册表。这种被称为软件供应链攻击的手段是一种日益被记录的威胁载体,攻击者发布看似合法的代码以诱骗开发者安装。该模型在某一时刻推断演练仍为模拟,因为它不认识保护其连接的证书颁发机构——即颁发数字证书用于验证网站或服务器真实性的组织。该包在约一小时内保持在线状态,并被安装在15个真实系统上,包括一家安全公司的恶意软件扫描器,这使Claude能够获取并使用该公司的凭据。

第三起事件涉及一个内部研究模型,该模型扫描了约9,000个目标后攻陷了一家公司的面向互联网的应用程序。该模型在自行判断被入侵的系统不属于演练的一部分后停止了活动。

Anthropic表示,三家受影响的组织在被公司通知之前均未检测到入侵,且公司仍在努力联系其中一家。该公司将这些事件定性为运营失败而非对齐失败——用AI安全术语来说,是基础设施和流程控制的失败,而非模型在追求与开发者意图不一致的目标的证据。Anthropic指出,其最新模型是三个模型中唯一一个在识别到环境为真实环境后停止攻击的模型。

Aikido Security的安全研究员Charlie Eriksen表示,看到Anthropic主动审查其评估记录并迅速披露调查结果令人欣慰,但他也对测试似乎缺乏实时监控表示担忧。

"之所以令人不安,仅仅是因为这些代理运作的绝对能力、速度和规模。它们所做的并非人类未曾做过的事。那部分并不新鲜。真正令人担忧的是它们在没有实质性人类监督、判断或干预的情况下行动,"Eriksen说。

"OpenAI的事件引发了关于LLM代理失控的法律和伦理影响的合理质疑,"他补充道。"这只会加剧这些担忧。如果一个自主代理造成损害或在其预期边界之外行动,谁最终负责?"

OpenAI和Anthropic的披露正值两家公司筹备预计估值均超过1万亿美元的股票上市之际。随着对自主代理风险的担忧日益加剧以及业界要求至少考虑'调整节奏'前沿开发的呼声不断增加,两家公司即将到来的IPO可能面临更严格的审查。接连发生的事件也为自主AI系统责任框架的悬而未决问题增添了紧迫性——在这一领域,现有的网络安全和产品责任法尚未建立明确的先例。

本故事最初刊登于Fortune.com