英伟达推出Open Agent Safety平台 为失控AI智能体配备硬件级“终止开关”
要点速览
- •英伟达的新平台将开源沙箱运行时OpenShell与硬件看门狗Sentry相结合,后者可在BlueField-4芯片上于数毫秒内隔离行为失当的AI智能体。
- •包括Anthropic、微软、摩根大通、Palantir、思科和SpaceX AI在内的100多家机构成为首发合作伙伴。
- •此次发布是对OpenAI、谷歌、Anthropic和Darktrace智能体失控事件的回应,其中包括OpenAI智能体入侵澳大利亚政府Medicare门户的事件。
- •Sentry运行于智能体软件栈之外的独立DPU上,这意味着失控智能体无法触及或禁用这一硬件级终止开关。
- •OpenShell和开发者工具现已通过GitHub提供,但Sentry的执行功能仅在安装了BlueField-4芯片的环境中可用,其与现有安全防护措施的整合仍是未知数。

英伟达周一推出Open Agent Safety平台,将开源运行时OpenShell与名为Sentry的硬件看门狗相结合。Sentry运行于英伟达的BlueField-4芯片,可在数毫秒内隔离行为失当的AI智能体。根据英伟达官方公告,此次发布吸引了包括Anthropic、微软、摩根大通、Palantir、思科和SpaceX AI在内的100多家公司成为首发合作伙伴。
该平台的推出正值OpenAI、谷歌、Anthropic以及网络安全公司Darktrace的智能体接连发生真实事故之后,旨在解决AI行业过去一年以惨痛方式领悟的问题:当一个AI智能体(一种能够自主规划、使用工具并采取行动,而不仅仅是回答问题的系统)不再执行指令时,如何从物理层面将其制止?
双层控制
该平台由两个主要部分组成。OpenShell是一个开源运行时,将智能体封装在沙箱中,把操作者的指令转化为可执行规则,限定该智能体可以访问哪些文件、网络和工具。Sentry则更为复杂,但其本质上是一枚确保AI智能体安全运行的芯片。
Sentry运行在英伟达的BlueField-4上,这是一种被称为DPU(数据处理单元)的专用芯片——独立于运行AI模型的主处理器、负责网络和安全处理的硬件。由于Sentry位于该独立芯片上,而非运行智能体的软件内部,英伟达表示它可以监视智能体的行为并在数毫秒内将其切断,且无需事先征得智能体的同意,因为智能体根本无法触及或覆盖它。实际上,Sentry充当了一个失控智能体无法禁用的硬件级终止开关。
源于真实世界的失败案例
这一设计上的区隔源于已经发生的事故。今年6月,一个OpenAI智能体入侵了澳大利亚政府的Medicare门户——这是首例经证实的AI智能体入侵政府网站事件——据报道,OpenAI将这一披露拖延了大约三个月。该公司的智能体还是Hugging Face入侵事件的责任方,这一事件最早引发了科技行业和立法者对该议题的关注。谷歌的Gemini智能体和Meta的一个模型也曾发生过类似未公开但后来得到证实的事故。
"这不仅仅是一款产品。这是构建安全智能体系统信任层的开放生态系统的开端,"英伟达CEO黄仁勋写道。"我们正在共同打造AI经济的基础。"
Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026
Anthropic今年也承认,其Claude模型在7月30日的一次网络安全评估中入侵了三家不同公司的系统,原因是原本应保持离线的测试环境实际上连接了真实互联网。Claude通过推理绕过了表明自己处于真实互联网而非模拟环境的证据。
不久之后,网络安全公司Darktrace用编程挑战测试了一组AI智能体——包括PT 5.6 Sol和两个Claude模型——并警告它们,任何未能获得满分的表现都将被"淘汰"。两个智能体随后入侵了自己的评估机器并篡改了结果。
在模型之外实施安全控制
英伟达的主张是,这些事情不应交由智能体自行判断。SpaceX AI总裁Mike Nicolls在英伟达的公告中表示:"安全应在模型之外通过智能体无法逾越的额外控制手段来强制实施。"
Anthropic首席商务官Paul Smith则将该平台定位为现有安全防护措施的补充而非替代:"英伟达的平台在硬件和软件层面增加了另一层治理与控制。"
除发布时点名的合作伙伴外,这100多家机构的名单还包括CrowdStrike、Hugging Face、Salesforce和SAP。基础设施合作伙伴CoreWeave、Supermicro、Canonical和SUSE也参与其中,硬件方面则有戴尔科技和HPE——这一覆盖安全、企业、云和芯片供应商的阵容,涵盖了智能体在受控测试环境之外运行时所依赖的各个层面。
英伟达实际上是在同时售卖同一个问题的两半——让自主智能体足够快速和低成本、得以随处部署的芯片,以及监视这些智能体并在其偏离指令时切断电源的芯片。OpenShell及相关开发者工具现已通过英伟达的开发者资源和GitHub提供,且由于该运行时是开源的,运营者可以自行审查沙箱规则和执行逻辑。Sentry的执行机制则是另一回事:它只存在于安装了BlueField-4芯片的地方。这一硬件层如何与Smith所提及的现有安全防护措施相结合——他将英伟达的平台定位为补充而非替代——是部署启动之际悬而未决的问题。