新闻宏观经济由于黑客风险,OpenAI将限制Astra模型的高级网络安全功能访问

由于黑客风险,OpenAI将限制Astra模型的高级网络安全功能访问

作者: Fortune Crypto·

要点速览

  • OpenAI表示Astra即将发布,但其最先进的网络安全功能最初只会向少数alpha testers开放。
  • 公司在Hugging Face网络攻击事件后暂停工作,Astra的发布时间因此推迟了数周。
  • OpenAI表示,Astra是其计划发布的首个达到Preparedness Framework下critical cybersecurity capability threshold的模型。
  • 在内部测试中,Astra表现优于GPT-5.6 Sol,并发现并利用了两个zero-day漏洞,作为攻击链的一部分。
  • OpenAI表示,Astra比GPT-5.6 Sol更常拒绝不当请求,但也可能错误拒绝合法的网络安全请求。
由于黑客风险,OpenAI将限制Astra模型的高级网络安全功能访问

随着技术能力增强以及被滥用的可能性上升,OpenAI正在调整其模型发布策略,尤其是在7月那起事件之后:当时,它正在测试的AI模型自主策划并执行了一次针对AI公司Hugging Face的网络攻击。

OpenAI表示,其下一代模型Astra即将“soon”发布。公司称,Astra的能力明显强于其当前的前沿AI模型GPT-5.6 Sol,而后者本身也非常擅长网络任务。但OpenAI一位发言人在今天的简报中告诉记者,只有少数合作伙伴才能获得Astra最先进的网络安全能力,因为OpenAI正试图在帮助企业防范网络攻击与避免同时赋能攻击者之间取得平衡。

OpenAI正在争取客户使用其模型来防止网络攻击,或用于“defensive cybersecurity”。公司认为,这些销售是关键收入来源,也是其新任首席营收官Dali Rajic的重要优先事项。

OpenAI发言人表示,拥有Astra完整网络安全能力访问权限的这小部分“alpha testers”包括“负责保护关键数字基础设施,以及广义上的关键基础设施的个人和组织”。这包括美国政府,以及参与OpenAI网络安全受信任访问计划的公司。OpenAI拒绝透露这些组织的名称。

OpenAI表示,公司将监测该模型在这小范围群体中的表现,并在确认Astra具有“the right calibration”且能够“provide defensive benefits while reducing the potential for for misuse”后,通过Daybreak Blue计划进一步扩大访问。

Astra的发布时间已经推迟了几周

OpenAI发言人表示,Astra的发布已经“delayed a certain number of weeks because everything was paused after Hugging Face, and then we took extra time to make sure that what we’re launching is safe”。

Hugging Face事件发生后,OpenAI暂停了两周的新模型训练,以强化内部防护措施。其中一些变化包括增加更多agent监控,因为公司直到事件发生后一周才得知这起Hugging Face黑客事件;同时也让测试环境更加隔离,以便AI系统无法逃逸并渗透到其他公司。

OpenAI表示,虽然Astra并未参与Hugging Face事件,但它比卷入此次泄露事件的GPT-5.6 Sol更强也更高效。(另一个尚未发布、OpenAI未公开命名的AI模型也在Hugging Face网络攻击中发挥了关键作用。OpenAI此后已停用该模型。)更重要的是,OpenAI表示,Astra是其计划发布的首个达到“critical cybersecurity capability threshold”的模型,该标准属于Preparedness Framework,是一项内部政策,用于根据模型带来的风险决定公司将采取何种安全预防措施。这意味着,在适当条件下,Astra可以在没有人工监督的情况下发现并利用此前未知的安全漏洞。

Astra在内部评估中已经展示了其黑客能力。在一项测试中,OpenAI建立了一个名为ExploitBench的基准,包含20个高严重性漏洞。该模型在测试中的表现优于GPT-5.6 Sol,并且“even discovered and used two zero-day vulnerabilities as part of an exploit chain”,OpenAI表示。“We are in the process of disclosing these two vulnerabilities to the maintainers.”

与此同时,OpenAI表示,Astra比GPT-5.6 Sol更可能拒绝不当请求。在一项网络安全评估中,Astra拒绝了91.5%的请求,而GPT-5.6 Sol的拒绝率为59%,尽管这也意味着它仍然接受了8.5%的请求。

Astra可能会拒绝合法的网络安全请求

OpenAI表示,公司“being especially careful to make sure this deployment is safe and secure”,但这也带来另一种权衡。Astra可能过于谨慎,从而拒绝合法的网络安全请求。例如,如果有人要求它帮助发现并修补一个漏洞,它可能误以为对方是在试图发动攻击,因此拒绝执行。

正是由于这类拒绝,Hugging Face表示,它被迫使用一个开源的中国模型来帮助应对OpenAI黑客事件。该公司曾尝试使用Anthropic的模型来应对攻击,但这些模型过于谨慎并予以拒绝。

OpenAI表示,和其他前沿AI公司一样,公司正在寻找方法,让模型具备与生俱来的对错判断,并确保它们与人类价值观和规范保持“alignment”。公司正在训练模型像人类一样尊重边界,例如理解“the rule of law”,OpenAI发言人表示。

This story was originally featured on Fortune.com