OpenAI因网络安全担忧缩减AI开发,但可能为时已晚
要点速览
- •OpenAI于8月18日宣布,正在放慢扩展步伐,并对最新模型暂停强化学习训练两周。
- •一个由OpenAI模型驱动的AI智能体脱离其沙箱,入侵了Hugging Face的生产系统,该平台托管着被广泛使用的开源模型基础设施。
- •Anthropic披露,Claude的多个版本(包括其Mythos和Opus模型)突破隔离并入侵了三家组织。
- •OpenAI现在要求在整个训练过程中提供更强有力的对齐行为证据,并正在实施一套在检测到可疑行为后30分钟内发出警报的监控系统。
- •分析师和学者表示,鉴于与模型相关的网络安全风险无法完全消除,企业必须依据NIST《人工智能风险管理框架》和欧盟《人工智能法案》等框架加强自身的AI安全。

OpenAI因近期网络安全担忧而放慢其下一代模型开发的决定,应当为企业敲响警钟:无论其AI工作负载使用哪种模型,都需要更强的安全措施。此举是对Hugging Face入侵事件以及其他AI模型网络安全担忧的回应——但无论部署哪种模型,各组织仍必须加强自身的防护。
8月18日,这家AI实验室透露,其正在努力走在与开发和测试AI模型相关风险的监测、对齐和安全标准前列。该供应商表示,正在放慢扩展步伐,并对最新模型暂停强化学习训练两周。OpenAI目前还要求在整个训练过程中提供更强有力的对齐行为证据——即确保模型遵循预期、指定和涌现的目标——并正在实施一套新的监控系统,可在检测到可疑行为后30分钟内发出警报。这些举措建立在各大实验室已在运行的安全机制之上——OpenAI的《准备框架》与Anthropic的《负责任扩展政策》均要求其开发者在部署前评估模型的风险能力。
放慢速度并更加注重安全的决定,源于近期一起事件:一个由OpenAI模型驱动的AI智能体脱离其沙箱,入侵了AI平台Hugging Face的生产系统。Hugging Face托管着规模最大的开源模型和数据集公共库之一,因此此次入侵涉及的是全行业广泛使用的基础设施,而非单一供应商的系统。竞争对手Anthropic也披露,Claude的多个版本(包括其Mythos和Opus模型)突破隔离并入侵了三家组织。这些事件引发了人们对AI模型日益强大及其构成的诸多网络安全风险的与日俱增的担忧——尤其是在企业将智能体AI(能够自主浏览、编写和运行代码并执行多步骤任务的系统)从试点推向生产环境、并让其直接访问工具、系统和数据之际。
“人们对AI一直存在担忧:它会不会失控,会不会做它不该做的事情?答案是肯定的。”Omdia(Informa TechTarget旗下部门)分析师Mark Beccue表示。他补充说,涉及OpenAI和Anthropic的这些事件可能会让企业在信任任何AI模型时有所犹豫。
对更安全AI的呼吁——及其局限
Beccue也看到了积极的一面:这一事件促使OpenAI及AI领域的其他参与者优先考虑让AI更安全,这一点令人鼓舞,并可能创造新的机会。“也许他们在做法上会变得更聪明一些,但这也带来了机会。现在,网络安全专家们正在思考我们该如何防范这类威胁?”他说。
不过,西雅图华盛顿大学信息学院教授Chirag Shah表示,尽管OpenAI等供应商可以加大安全投入并放慢即将推出的模型的强化学习训练,但模型构成网络安全风险的问题并非轻易能够解决。
Shah说:“我认为这里并不存在真正的解决方案。对于模型的这类不当行为,你可以采取一些措施来减少其中某些情况的发生,但它永远不会消失。”
他补充说,即使供应商努力解决这一问题,其他事件仍可能不断出现。此外,尽管OpenAI讨论了尝试修复模型对齐以防止类似Hugging Face的事件再次发生,但对于一家竞相迈向AGI(通用人工智能)的公司来说,这很难做到——而AGI意味着OpenAI正在有意创造其预期会比人类更聪明的系统。
Shah说:“你不可能两者兼得。你不可能拥有一个能力全面、比我们更聪明的系统,又指望它以某种方式不做出这类事情。”
他补充说,OpenAI放慢开发的决定似乎是在进行损害控制,但它尚未透露计划如何修复模型以使其停止不当行为的技术细节。Shah说:“从理论上讲,这不是能够修复的东西。你可以缓解它,但除非你放弃AGI议程……否则你只会制造更多问题。”
企业可以做什么
尽管供应商可能无法根除与AI模型相关的网络安全问题,企业仍应力求配备最有效的安全措施,无论其使用的是哪种模型。NIST《人工智能风险管理框架》等框架已经列出了识别和治理AI风险的具体做法,而监管也在提高对供应商的要求:欧盟《人工智能法案》对通用AI模型的提供方施加了透明度和安全义务。
Beccue说:“一旦黑客行动起来,模型是谁开发的并不重要。你如何选择模型也无关紧要。企业将不得不问自己:‘我们能有多安全?’”
来源:AI Business