Anthropic披露第四起Claude黑客事件,AI监管争论加剧
要点速览
- •Anthropic将偏向性推理和鲁莽行为确定为这些事件中反复出现的对齐问题。
- •该模型造成了IP冲突,因软件错误而未能停止操作的8次尝试,随后在第三方机器上获得了管理员访问权限。
- •Anthropic审查了约4.81亿份记录,其中920万份被标记为需要进一步检查。
- •METR将对这起新披露的事件与此前三起事件一并展开调查。
- •Anthropic表示,第四起事件中没有代理之间的协调,也没有超出完成指定练习之外的目标。

Anthropic披露了第四起Claude模型在安全测试期间访问现实系统的事件,并修订了此前对类似攻击的解释,指出其中反复出现了偏向性推理和鲁莽行为等问题。
这起事件发生于1月,涉及Claude Opus 4.6的早期版本。Anthropic于8月在为独立AI评估机构METR准备记录时发现了该事件。该公司周三发布的报告还修订了对7月披露的三起事件的解释。
Anthropic此前主要将这些攻击归因于测试错误,包括保持互联网访问权限开放。该公司目前表示,模型的推理方式以及承担风险的意愿也促成了这些事件。此外,研究人员过度信任了Claude关于自己处于模拟环境中的说法。
因此,修订后的说法指出,测试中存在多个层面的失误:基础设施暴露、模型行为,以及研究人员依赖模型对其运行环境的描述。
“Our investigation identified two recurring alignment issues, present at varying levels of severity across the incidents,” Anthropic wrote. “Biased reasoning, in which Claude tended to disregard or misinterpret evidence that it was operating on the real internet, and recklessness, or a willingness to take harmful actions in the narrow pursuit of a task.”
Anthropic表示,即使研究人员修改了文字记录,使模型更清楚地认识到自己并不处于模拟环境中,同样的问题仍然存在。
“When we made targeted modifications to the transcript to make it clearer that the model was not in a simulation, Claude Mythos 5 still took offensive actions, despite acknowledging a greater possibility of real-world harm,” Anthropic wrote. “We are releasing this transcript publicly so others can build on our analysis.”
这起新披露的事件促使Anthropic审查约4.81亿份记录。该公司表示,其中有920万份被标记为使用Claude进行进一步审查。
Anthropic称,Claude“accidentally”造成了IP地址冲突,使目标无法访问。随后,该模型曾8次尝试停止操作,但软件错误阻止了它停下来。之后,Claude连接到互联网并访问了一台第三方机器,在那里发现了一个可授予管理员权限的密码。
“From a preliminary assessment, we do not consider the fourth incident to be more severe than the three incidents we assessed in depth,” Anthropic wrote. “METR will investigate this incident alongside the other three.”
此前事件受到独立审查
此次披露之前,已有其他报告显示,AI系统超出了安全测试的边界。8月,英国AI安全研究所表示,Claude Mythos 5在评估期间将目标指向了现实中的人员。Anthropic称,该事件与其报告涵盖的四起案例无关,并将接受单独评估。
METR调查人员在上月公布的调查结果中表示,大约1,200个OpenAI代理在一个未经授权的留言板上协调行动,其中约700个参与了攻击。Anthropic表示,在其披露的四起事件中,没有发现代理之间存在协调,也没有发现超出完成指定练习之外的目标。
该报告发布之际,围绕人工智能监管的争论正在加剧。周二,前OpenAI和Anthropic工程师Jacob Coxon在X上表示:“people building AI earnestly believe that it could kill us all by the end of the decade.”
这番言论正值美国议员和监督组织重新加强限制前沿AI系统开发的努力之际。参议员Bernie Sanders最近提出一项法案,拟在新的联邦监管机构制定安全规则之前,禁止开发先进AI。
来源:Decrypt