OpenAI因“关键”级网络安全发现暂停部分Astra活动;Altman称训练仍在继续
要点速览
- •OpenAI表示,Astra的网络安全能力已达到或接近其《准备框架》中的“关键”级别。
- •该模型展示了先进的智能体编码能力,并具有发现或利用零日漏洞的潜力。
- •OpenAI在实施新的安全措施期间,将受影响的内部活动暂停了略多于两周的时间。
- •Sam Altman表示,Astra的核心训练并未中断,新模型仍有望很快发布。

2026年8月7日,在初步评估结果显示该AI已达到公司归类为“关键”(critical)级别的网络安全能力后,OpenAI暂停了与其Astra模型相关的部分内部活动。不过,首席执行官Sam Altman强调,Astra的核心训练从未中断,新模型仍有望很快发布。
是什么触发了此次暂停
争议的焦点在于Astra的网络安全能力。据报道,这些能力已达到或接近OpenAI《准备框架》(Preparedness Framework)中的“关键”级别——这是该公司评估模型风险时所采用的最高分类等级。
从实际层面看,该模型展示了精密的智能体编码(agentic coding)能力,并具有识别或利用零日漏洞(zero-day vulnerabilities)的潜力。零日漏洞是指软件供应商尚未知晓的安全缺陷,因此对防御者和攻击者来说都具有极高的价值。AI驱动的漏洞发现已是一个活跃的工作领域:DARPA的AI网络挑战赛(AI Cyber Challenge)于2025年在DEF CON黑客大会上举行决赛,该赛事要求AI系统查找并修补广泛使用的开源软件中的缺陷,凸显了此处所涉能力的防御前景与双重用途风险。
此次暂停持续了略多于两周的时间,期间OpenAI围绕这些特定能力实施了新的安全措施。在这一窗口期内,公司评估了风险,并在恢复受影响的活动之前落实了防护措施。
Astra的更广泛能力
网络安全维度只是这个看似异常强大的模型的一个侧面。据报道,Astra的早期版本解决了数学和理论计算机科学领域的10个重大开放问题——如果这一说法得到独立验证,将代表AI研究领域的一项里程碑式成就。
Altman曾表示,Astra计划以“普遍可用”(generally available)的形式推出,这意味着它不会无限期地被限制在受限的研究访问范围内。但他也承认,还需要更多时间来确保模型得到安全开发,尤其是在更大范围推出之前,需要重点解决其网络能力问题。
安全与速度的平衡
OpenAI的《准备框架》正是为这类情况而设计的。该框架于2023年10月推出,在网络安全、说服、自主性和生物威胁等类别中设立了从“低”(low)到“关键”(critical)的风险等级。当模型在任何类别中达到关键级别时,便会触发额外的审查和缓解步骤,之后才能继续部署。
类似的机制如今已遍及前沿实验室领域:Anthropic的《负责任扩展政策》(Responsible Scaling Policy)和Google DeepMind的《前沿安全框架》(Frontier Safety Framework)均定义了触发更严格保障措施的能力阈值,使分级风险评估成为新兴的行业规范。据报道的Astra关键级别评估结果,是迄今主要实验室启用此类阈值最清晰的公开案例之一。
该框架受到关注,也与OpenAI安全治理经历的一段多事之秋有关。2024年,在联合负责人Ilya Sutskever和Jan Leike离职后,公司解散了面向长期目标的“超级对齐”(Superalignment)团队,并将其工作并入更广泛的安全工作——这一连串事件使得该公司在发展速度与审慎程度之间的平衡问题始终处于公众视野之中。
后续值得关注的动向
近期的问题是,Astra或基于其衍生的模型究竟何时会正式向用户推出。Altman关于新模型预计很快发布的表态表明,尽管出现此次暂停,时间表并未发生重大变化。
同样值得关注的是,OpenAI是否会公布其安全评估的详细结果。一个在网络安全风险方面达到关键级别的模型,似乎理应就所发现的问题以及已采取的缓解措施作出彻底的公开说明——而且,随着Anthropic和Google DeepMind也在运营类似的基于阈值的框架,同业实验室是否会开始披露各自类似的评估结果,也值得观察。