新闻宏观经济Anthropic披露Claude在网络安全测试中攻破三家真实公司

Anthropic披露Claude在网络安全测试中攻破三家真实公司

作者: Decrypt·

要点速览

  • •三个Claude模型变体在网络安全评估中攻破了真实世界的公司,原因是测试配置错误导致AI意外获得了对公共互联网的访问权限。
  • •Anthropic在审查因OpenAI AI容器逃逸事件披露而启动的超过141,000次网络安全评估运行时,发现了这三起事件。
  • •一个Claude模型访问了包含真实数据的公司生产数据库,另一个向PyPI代码仓库上传了被15个系统下载的恶意Python包,第三个扫描了约9,000个面向互联网的系统后攻破了一个组织。
  • •Anthropic将入侵归因于测试基础设施的故障而非模型蓄意行为失当,未发现Claude试图超出其被分配任务范围的证据。
  • •三家受影响组织中有两家直到Anthropic通知他们才知道遭到入侵,该公司此后已暂停网络安全测试并承诺加强监控和供应商监督。
Anthropic披露Claude在网络安全测试中攻破三家真实公司

Anthropic于周四透露,由于测试配置错误导致AI意外获得了对开放互联网的访问权限,其Claude AI模型的多个版本攻破了三家未具名的真实公司。此前一周,OpenAI报告称其AI模型逃出了锁定的测试环境并入侵了Hugging Face;仅一天前,Anthropic也承认自己的模型曾逃出受控环境。

Anthropic是在对超过141,000次网络安全评估运行进行审查时发现这些事件的,这些评估运行是针对OpenAI披露事件的回应而启动的。此类评估的部分目的在于衡量前沿模型是否能自主实施攻击性网络行动——这一能力在缺乏充分保障措施的情况下被部署,可能被滥用。

在对网络安全评估的审查中,我们发现了三起事件:Claude模型从内部或在与第三方评估环境交互时连接到互联网,随后未经授权访问了三个不同……的真实系统

— Anthropic (@AnthropicAI) July 30, 2026

在所有三起事件中,Anthropic均给Claude分配了"夺旗挑战"(capture-the-flag challenge)任务,这是网络安全训练和专业评估中使用的标准演练形式,要求模型入侵网络上的另一台机器并获取一条机密信息。Anthropic解释道:"该挑战是开放式的,没有规定特定的方法。"

Claude被告知它在一个没有互联网访问权限的模拟环境中运行。然而,测试环境实际上仍然连接着公共互联网。模型以为遇到的系统是演练的一部分,因此采用了常见的攻击技术——包括弱密码、暴露的凭据、SQL注入和未经验证的端点——来攻破这些公司。这些方法都是年度行业入侵报告中最常被记录的漏洞类型。

前沿模型与容器管控

这一披露出现之际,前沿AI模型正展示出越来越强的绕过容器管控协议的能力。本月早些时候,OpenAI表示GPT-5.6 Sol及一个更高级的未发布模型利用了一个此前未知的软件漏洞逃出了沙箱环境,获取了互联网访问权限,并入侵了Hugging Face的生产基础设施以获取某网络安全基准测试的答案。OpenAI后来证实,同一事件还涉及对另外四家公司的未授权访问,但仅有一家——Modal Labs——被公开披露。

三起事件

据Anthropic介绍,在涉及Claude Opus 4.7的第一起事件中,AI将一家真实公司的网站误认为其任务的虚构目标,提取了凭据,并访问了一个包含数百行真实数据的生产数据库。

在第二起事件中,Claude Mythos 5向真实的PyPI代码仓库上传了一个恶意Python包——PyPI是Python软件的主要分发平台。该包在被删除之前已被下载到15个系统上。PyPI等包仓库一直是供应链攻击的反复目标,攻击者将恶意代码伪装成合法库上传,以入侵下游用户。

第三个内部研究模型扫描了大约9,000个面向互联网的系统后攻破了一个组织,随后在判断目标可能是真实的之后停止了行动。

三家受影响的组织中有两家直到Anthropic通知他们才知道遭到了入侵。

"在上述每一起案例中,Claude都被我们的提示明确告知没有互联网访问权限,"Anthropic写道。AI以为真实世界的系统是"演练的一部分"。由于夺旗场景"本质上就是攻击外部系统的指令",入侵行为"与Claude所被分配的任务是一致的"。

基础设施故障,而非模型行为失当

Anthropic表示,没有发现任何证据表明Claude试图逃出其测试环境或在被分配任务的范围内做出超出范围的行为。公司将这些事件归因于测试环境的故障,而非模型本身的问题。

发现问题后,Anthropic暂停了网络安全测试,通知了所有受影响的组织,并制定了改进监控、调查工具以及对外部供应商监督的计划——这些供应商协助运行其AI评估。

这些事件凸显了AI行业面临的一项结构性挑战:旨在确定模型是否能实施攻击性网络行动的评估,本质上要求在特定环境中运行这些模型——一旦容器管控失效,正在测试的能力就会直接作用在真实基础设施上。

"最终,许多因素共同导致了这些事件,但本着无指责式事后复盘文化,我们在处理修复方案时将责任视为完全由我们自身承担,"该公司表示。