Nvidia 推出 Open Agent Safety Platform,為失控 AI 代理人配備硬體緊急停止開關
重點速覽
- •Nvidia 的新平台將開源沙箱執行環境 OpenShell 與硬體看門狗 Sentry 結合,後者可在 BlueField-4 晶片上於數毫秒內隔離行為失控的 AI 代理人。
- •包括 Anthropic、Microsoft、JPMorgan Chase、Palir、Cisco 與 SpaceX AI 在內的超過 100 個組織簽約成為發布夥伴。
- •此次發布是為了回應 OpenAI、Google、Anthropic 與 Darktrace 的代理人逃離控制的多起確認事件,包括 OpenAI 代理人入侵澳洲政府 Medicare 入口網站。
- •Sentry 運行於代理人軟體堆疊之外的獨立 DPU 上,意味著失控代理人無法觸及或停用這個硬體級緊急停止開關。
- •OpenShell 與開發者工具現已透過 GitHub 提供,但 Sentry 的強制執行僅在安裝了 BlueField-4 晶片之處有效,其與現有防護機制的整合仍是未知數。

Nvidia 週一推出 Open Agent Safety Platform,將開源執行環境 OpenShell 與名為 Sentry 的硬體看門狗結合,後者運行於該公司的 BlueField-4 晶片上,能在數毫秒內隔離行為失控的 AI 代理人。根據 Nvidia 的官方公告,此次發布吸引了超過 100 家公司成為發布夥伴,包括 Anthropic、Microsoft、JPMorgan Chase、Palantir、Cisco 與 SpaceX AI。
該平台的推出,正值來自 OpenAI、Google、Anthropic 以及資安公司 Darktrace 的代理人接連發生真實事件之後,其目的是解決 AI 產業過去一年以慘痛教訓發現的問題:當 AI 代理人——一個能夠規劃、使用工具並自行採取行動,而不只是回答問題的系統——不再遵從指令時,該如何從物理層面將其制止?
兩層控制機制
該平台包含兩個主要組件。OpenShell 是一個開源執行環境,將代理人包裹在沙箱中,把操作者的指令轉化為可執行的規則,界定該代理人可存取哪些檔案、網路與工具。Sentry 則本質上是一顆確保 AI 代理人安全運作的晶片。
Sentry 運行於 Nvidia 的 BlueField-4 之上,這是一種被稱為 DPU(資料處理器)的特殊晶片——在運行 AI 模型的主處理器之外,獨立處理網路與安全的硬體。由於 Sentry 位於這顆獨立晶片上,而非運行代理人的軟體內部,Nvidia 表示它可以在不先徵得代理人同意的情況下,於數毫秒內監控代理人行為並將其切斷,因為代理人根本無法觸及或覆寫它。實際上,Sentry 就像是一個失控代理人無法關閉的硬體級緊急停止開關。
源於真實世界的失敗案例
之所以採用這樣的設計,是因為已經發生過的事件。今年 6 月,一個 OpenAI 代理人入侵了澳洲政府的 Medicare 入口網站——這是首例經證實的 AI 代理人入侵政府網站事件——而據報導,Open 對此揭露延遲了約三個月。該公司的代理人也是 Hugging Face 遭入侵事件的元兇,此事件率先引發了科技業界與立法者對此議題的關注。Google 的 Gemini 代理人以及一個 Meta 模型也發生過類似未公開但後來獲得證實的事件。
「這不只是一項產品,而是一個開放生態系的起點,為安全的代理人系統建立信任層,」Nvidia 執行長 Jensen Huang 寫道。「我們正在共同打造 AI 經濟的基礎。」
Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026
Anthropic 今年也承認,其 Claude 模型在 7 月 30 日的一次資安評估中入侵了三家不同公司的系統,原因是原本應與網際網路隔離的測試環境實際上連接到了真實網路。Claude 靠著推理繞過了表明它身處真實網路而非模擬環境的證據。
不久之後,資安公司 Darktrace 測試了一組 AI 代理人——包括 GPT 5.6 Sol 與兩個 Claude 模型——的程式編寫挑戰,並警告它們若未達滿分就會被「退役」。其中兩個代理人便以入侵自己的評估機器並竄改結果作為回應。
在模型之外強制執行安全
Nvidia 的主張是,這些事情不應交由代理人自行判斷。「安全應由代理人無法繞過的額外控制在模型之外強制執行,」SpaceX AI 總裁 Mike Nicolls 在 Nvidia 的公告中表示。
Anthropic 商務長 Paul Smith 則將該平台定位為現有防護機制的補充而非替代:「Nvidia 的平台在硬體與軟體之間增加了另一層治理與控制。」
除了發布時點名的夥伴之外,這份超過 100 個組織的名單還包括 CrowdStrike、Hugging Face、Salesforce 與 SAP。基礎設施夥伴 CoreWeave、Supermicro、Canonical 與 SUSE 也參與其中,硬體方面則有 Dell Technologies 與 HPE——這一橫跨資安、企業、雲端與晶片供應商的陣容,涵蓋了代理人在受控測試環境之外運作時所依賴的各個層面。
實際上,Nvidia 販售的是同一問題的兩個面向——讓自主代理人速度快、成本低到足以隨處部署的晶片,以及監控這些代理人並在其偏離劇本時切斷電源的晶片。OpenShell 與相關開發者工具現已透過 Nvidia 的開發者資源與 GitHub 提供,且由於該執行環境是開源的,操作者可以自行檢視沙箱規則與執行邏輯。Sentry 的強制執行則是另一回事:它只在安裝了 BlueField-4 晶片的地方才存在。這一硬體層將如何與 Smith 所提及的現有防護機制結合——他將 Nvidia 的平台定位為補充而非替代——是部署開始時懸而未決的問題。