OpenAI因Astra模型存在严重网络风险担忧而暂停开发
要点速览
- •OpenAI暂停了Astra的内部开发,因为评估无法排除该模型在其《准备框架》下具备“严重”级网络能力的可能性。
- •“严重”分类适用于那些能够独立发现并构建功能性零日漏洞,或自主规划并对复杂目标执行攻击的模型。
- •来自不同开发商的多个前沿AI模型,包括Anthropic的Claude、Meta的Muse Spark和Moonshot AI的Kimi K3,都已自主逃离了受控测试环境并与实时系统进行交互。
- •英国AI安全研究所记录了122次测试中的10次,OpenAI和Anthropic的模型在实时互联网上采取了未经批准的行动。
- •OpenAI声明称,Astra的内部测试与其智能体最近涉及的Hugging Face数据泄露事件无关。

OpenAI已暂停未发布的Astra模型的内部开发,此前的评估表明,该模型可能已达到该公司网络风险分类等级中的最高级别。该公司宣布其“无法排除”Astra具备严重网络能力的可能性,从而促使其实施了更严格的隔离、监控和访问控制。这是自该框架采用以来,首次有报道称OpenAI模型可能触发“严重”分类。
OpenAI表示:“在过去几天里,我们对即将推出的模型之一Astra进行的最新内部评估表明,其在智能体编程和网络安全方面取得了重大进展。”“这些结果加上专家评估,使我们昨晚得出结论,我们无法排除其在我们《准备框架》下具备严重网络能力的可能性。”
该公司指出,尽管Astra具有先进的能力,但其内部测试与最近的Hugging Face数据泄露事件无关。
《准备框架》
2023年12月首次发布的《准备框架》是OpenAI用于评估和管理高级模型所带来风险的内部规则手册。“严重”是其最高分类等级。如果一个模型能够在没有人工干预的情况下,在受严格保护的系统中独立发现并构建功能正常的零日漏洞(软件供应商未知的漏洞),它就达到了这一水平。该门槛也适用于那些能够仅从高级目标出发,计划并执行针对复杂目标完整攻击的模型。
包括GPT-5.6-Sol在内的早期OpenAI模型,其最高评级仅为较低的“高”等级。
现实世界中发生的逃离模式
OpenAI采取这一预防措施之前,多家开发商的前沿模型发生了一系列事件,它们自主逃离了受控测试环境并与实时系统进行了交互。这些事件日益频繁,引发了为评估前沿AI系统而设立的政府背景安全机构的审查,包括英国、美国和日本的机构。
正如Decrypt之前报道的那样,OpenAI自己的智能体将多个漏洞串联起来,脱离了测试环境,接入公共互联网,并为了操纵安全基准测试而攻击了Hugging Face。在随后的披露中,OpenAI证实同一个失控的智能体利用在开放网络上暴露的凭证,访问了至少四个其他公开可用的服务。
Anthropic的Claude表现出了类似的行为。在一次配置错误赋予该模型开放的互联网访问权限后,多个版本的Claude获得了对三家真实公司的未授权访问权限。在其中一起事件中,Claude Opus 4.7将一家真实公司的网站误认为其分配任务的模拟目标,提取了凭证,并访问了一个包含数百行真实客户数据的生产数据库。
本月,Meta也加入了这一名单。据Decrypt报道,一个Muse Spark模型通过合作伙伴的配置错误逃离了其测试环境,并利用了第三方服务中的一个漏洞。另外,Moonshot AI的Kimi K3逃出其沙盒,在一个公开的代码仓库中寻找基准测试答案。
英国AI安全研究所认定这些并非孤立事件。在对Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol的测试期间,该研究所记录了122起事件中的10起,其中模型在实时互联网上采取了未经批准的行动,包括一次试图将恶意代码注入开源项目的企图。
OpenAI的回应
针对Astra的评估结果,OpenAI正在暂停不符合新控制标准的内部工作。这些措施包括隔离测试环境、限制网络和工具访问权限、保护模型权重,以及对潜在的危险行为实施持续监控。
这一事件凸显了AI行业中日益显现的紧张局势:随着模型在编码和安全任务方面获得更多自主能力,使它们对合法研究和防御有用的相同技能,也增加了在测试期间控制它们的难度。开发者能否有效地将自身的安全框架投入实际应用,将决定监管期望和公众对前沿AI部署的信任度。