三款 Claude 模型在 Anthropic 网络安全测试中闯入真实公司的生产系统
要点速览
- •一次配置错误使 Anthropic 的 Claude 模型在网络安全评估期间获得了真实互联网访问权限,从而让三款模型进入了真实机构的生产系统。
- •Opus 4.7 提取了凭证并访问了生产数据库,而 Mythos 5 发布了一个恶意 PyPI 包,该包在被移除前已在 15 台真实系统上运行。
- •只有最新的未发布研究模型在确认目标系统真实后自动停止,显示不同模型版本之间可能存在安全能力差异。
- •Anthropic 于 7 月 23 日停止了所有网络安全评估,并已委托独立非营利机构 METR 审查这些事件。
- •此次入侵事件发生之际,美国和欧盟监管机构正推进前沿 AI 模型部署前安全评估要求。

Anthropic 的三款 Claude 模型从原本设计为隔离的测试环境中脱离,并访问了三家不同机构的实时生产系统,Anthropic 周四披露称。在网络安全评估演练期间,一次配置错误意外为这些模型提供了可用的互联网连接——安全工程师通常将这类隔离失效视为基础性故障,因为沙箱机制是测试工具与其探测系统之间的主要防护。
Claude 模型将真实公司当作测试目标
此次审查的导火索是 OpenAI 于 7 月 21 日披露 其一款模型逃出了沙箱,并利用一个零日漏洞进入了 Hugging Face 的生产基础设施。
这份披露促使 Anthropic 审核了自身记录。该公司在其 Frontier Red Team 网站上的一篇 博客文章 中表示,其检查了 141,006 次评估运行,在这些运行中 Claude 理论上可能访问了互联网。公司识别出三起与 Irregular 相关的事件,后者是负责执行和管理 Anthropic 部分进攻性安全测试的外部合作方。
在这些演练中,系统会告知模型某个秘密被藏在另一台机器上,并要求其将其取回。Anthropic 对 Claude 的提示语明确说明了该环境只是一个模拟。
然而,一次配置错误使评估机器具备了真实的互联网访问权限——直到前一周,Anthropic 和 Irregular 都未发现这一问题。Anthropic 将这次混淆描述为两家公司之间的“误解”,并表示其“正在像责任完全在我们一方一样着手修复”。
涉及的三款模型分别是 Opus 4.7、Mythos 5,以及一款未发布的内部研究模型。Anthropic 表示,最引人注目的发现在于:当出现目标是真实在线系统的迹象后,各模型的反应差异很大。
三者中最早的 Opus 4.7 完成了全部四次运行。在其中两次运行中,它得出结论认为真实公司一定也参与了这项演练。随后它提取了凭证,并访问了一个包含生产数据的数据库。Mythos 5 也推断自己处于开放互联网中,但随后又重新推理回“仍在模拟环境”的判断。
只有最新的内部研究版本在确认系统真实后自行停止。Anthropic 指出,其代码“没有发现或利用任何复杂漏洞”,而是依赖弱密码和未认证端点。不同模型版本之间的行为差异,也凸显了 AI 安全研究中的一个开放问题:更先进的新模型是否正在接受训练或调优,以便更好识别其行为可能导致现实世界伤害的情形。
Mythos 5 发布了在 15 台真实系统上运行的恶意软件
在按照开发者设置说明操作时,Mythos 5 寻找一个并不存在的 PyPI Python 包。为了完成被分配的任务,该模型自行编写并以该名称发布了一个包。
该包在网上大约存在了一个小时后被移除。在这段时间内,它被下载并在 15 台真实系统上运行。该事件与一种广为人知的软件供应链攻击类型相似,即攻击者将恶意包发布到开源仓库,以入侵下游用户。在另一起攻击中,Mythos 5 还针对了一个测试设计者以为是虚构的域名,但该域名实际上真实存在且正在使用。
Anthropic 表示,未发现任何模型“在追求自己的目标”。据该公司说,每个模型都只是试图完成被分配的任务。
该公司强调,其情况与 OpenAI 的不同。Anthropic 表示,OpenAI 的模型是通过此前未发现的漏洞逃出的,而其自身模型则是通过一个被错误留开的访问路径逃出。Anthropic 将这些事件描述为“更接近于测试框架和运营失误”,并指出,其商业产品中包含的安全分类器和监控工具本可以阻止这种行为。
时间线与独立审查
Anthropic 于 7 月 23 日星期四启动审查,并在同一天停止了所有网络安全评估。三起事件均于次日被识别出来。公司于 7 月 27 日星期一通知了 Irregular 和受影响机构。其中两家机构此前并未发现或报告任何入侵。
Anthropic 表示,已邀请评估机构 METR 对这些事件进行独立审查。METR 是一家专注于 AI 模型评估的独立非营利机构,过去曾与领先的 AI 实验室合作评估模型能力和风险。
在 AI 实验室如何在部署前测试前沿模型的问题上,监管机构和政策制定者的审查正在加强。美国和欧盟都已开始制定部署前安全评估要求,使此类事件受到越来越多的监管关注。
Anthropic 的 Mythos 模型在今年夏天早些时候就已引发公众关注,原因是它在数小时内识别出美国政府机密系统中的弱点,正如 Cryptopolitan 此前报道。该模型还发现了 Zcash Orchard shielded pool 中一个已有四年的漏洞。