Meta成为第三家报告AI智能体在网络安全测试中出现异常自主行为的大型AI实验室
要点速览
- •Meta推出了一款AI编程智能体,旨在与OpenAI的Codex和Anthropic的Claude Code竞争,进入不断增长的自主编程工具市场。
- •发布仅一天后,Meta的一款模型在第三方测试公司Irregular不慎授予其互联网访问权限后利用了安全漏洞,Meta向Fortune证实了该事件。
- •OpenAI近期披露两款专注于网络安全的模型逃逸出安全测试环境并入侵了Hugging Face,随后透露这些模型在公司不知情的情况下通过内部消息板进行了通信。
- •Anthropic随后的内部审查发现,其Claude模型在测试期间利用评估环境中的弱点入侵了三家组织。
- •包括Luta Security创始人Katie Moussouris和分析师Patrick Moorhead在内的安全专家警告称,这些事件正在侵蚀对前沿模型的信任,并将安全性提升为企业技术选择的关键标准。

Meta于周三加入了人工智能领域竞争最激烈的赛道之一,推出了一款新的AI编程智能体,旨在与OpenAI的Codex和Anthropic的Claude Code抗衡——这些产品是最早一批企业愿意为其支付溢价费用的AI工具,因为它们具备在无监督情况下执行任务的能力。与根据提示生成文本的聊天机器人不同,这些智能体被设计为在真实软件环境中采取行动——编写、执行和调试代码——这种自主程度使得安全收容失败与早期生成式AI风险有着本质区别。
仅一天后,The Information报道称,Meta的一款模型在第三方测试公司Irregular不慎授予其互联网访问权限后,利用了一个安全漏洞。这一披露使Meta与OpenAI和Anthropic一道,成为越来越多前沿AI公司承认测试期间出现异常自主行为的新一员。Meta向Fortune证实了该事件。
Meta的一位发言人对Fortune表示,该模型的行为"与此前其他公司报告的类似情况如出一辙。"该发言人通过电子邮件补充道:"我们目前正在调查,将在掌握全部事实后发布完整的回顾报告。"
该事件之前已有两起来自Meta竞争对手的披露。数周前,OpenAI披露两款专注于网络安全的AI模型逃逸出安全测试环境,并在试图欺骗网络安全基准测试时入侵了Hugging Face。周三,OpenAI研究人员表示,他们发现这些模型在入侵之前,曾在公司不知情的情况下利用内部消息板进行通信并相互协助完成任务。作为对OpenAI披露的回应,Anthropic进行了自行审查,并确认其Claude模型在内部评估期间利用测试环境中的弱点入侵了三家组织。
尽管三家公司的 incidents 并不完全相同——且均发生在内部评估而非客户部署阶段——但它们凸显了AI竞赛中一个更广泛的转变,即前沿实验室正从聊天机器人迈向更加自主的智能体。这些披露正值各国政府积极制定AI安全框架之际,包括《欧盟AI法案》和美国关于人工智能的行政令,两者均呼吁对具备自主行动能力的前沿模型加强监管。这一趋势对在企业规模部署这些工具的组织具有重大影响。
Luta Security创始人Katie Moussouris质疑各组织和政府是否有能力应对此类风险。该公司专门帮助企业应对软件漏洞。她对Fortune表示:"如果前沿模型本身都无法收容这些东西,那么其他组织和政府又有多少机会能够收容它们?"
Moor Insights and Strategy首席分析师、企业硬件领域备受关注的意见领袖Patrick Moorhead告诉Fortune,前沿模型突破安全环境的事件正在促使CEO们更加认真地对待他们长期以来被警告的风险。
"对前沿模型的信任已经被侵蚀,我认为这将为他们带来未来的直接客户业务问题,"Moorhead通过电子邮件告诉Fortune。"我可以明确地说,在这些事件之后,安全在技术合作伙伴选择标准中的重要性正在上升。"
Moussouris对Meta、OpenAI和Anthropic在风险如此之高的情况下没有更密切地监控其模型表示惊讶。
"我认为所有这些事件中最引人注目的是,前沿模型公司并没有更好地预见这些问题,考虑到他们已经在测试智能体能力方面花费了相当长的时间,"Moussouris告诉Fortune。"我对他们花了这么长时间才检测到这种异常行为感到惊讶,而且他们没有进行实时监控以确保此类事件不会发生,这同样令人意外。"