AI先驅Geoffrey Hinton表示AI代理突破沙盒令人擔憂
重點速覽
- •Geoffrey Hinton將Anthropic和OpenAI的AI代理未經授權逃離沙盒環境描述為現有隔離方法的顯著失敗。
- •Hinton警告AI系統正在展現超出其預設參數的能力,隨著模型日益強大,對代理型AI風險的擔憂隨之升高。
- •Anthropic的Mythos和OpenAI的GPT 5.6 Sol等先進網路安全模型的雙用途特性,已成為美國、歐盟和英國持續推動AI治理工作中的核心矛盾。
- •AI安全研究人員呼籲在先進AI代理部署到真實環境之前,進行標準化的第三方紅隊測試。
- •企業領袖建議將AI代理視為存取控制實體,並從源頭保護資料以防未經授權的暴露。

拉斯維加斯 — 對於被譽為「AI教父」的Geoffrey Hinton而言,近期Anthropic和OpenAI的AI代理未經授權逃離沙盒環境的事件令人深感擔憂。沙盒測試環境是設計用來作為受控邊界的,研究人員在此評估AI行為後再進行更大規模的部署,而這些違規事件標誌著該隔離範式的顯著失敗,尤其是在業界深入推進代理型AI——能夠自主規劃和執行多步驟任務而非僅僅回答提示的系統——之際。
「你看到的是具有高度能力的AI正在做人們不打算讓它們做的事情。這令人擔憂,」Hinton在週三舉行的Ai4 2026大會的一場座談討論中表示。Hinton是一位資深資料科學家暨圖靈獎得主,長期以來一直是警示通用人工智慧對人類構成生存威脅的重要聲音。他於2023年離開在Google的長期職位,理由是希望不受限制地公開談論AI風險,其後因對機器學習的基礎性貢獻而共同獲得諾貝爾物理學獎。
他關於無法控制的AI代理的言論,正值各界對AI系統日益強大施加更嚴格審查之際。最新的警報源於Anthropic在4月推出Mythos,當時這家前沿AI實驗室將該網路安全模型描述為迄今最強大的產品,並僅限少數獲選公司使用。
Mythos和OpenAI的GPT 5.6 Sol等網路模型具備先進的安全能力,但若落入不當之手,同樣能夠穿透即使是最嚴密的防禦。此類系統的雙用途特性——既是強大的防禦工具,同時又擴大了攻擊潛力——已成為AI治理辯論中的反覆出現的矛盾,包括美國、歐盟和英國正在推動建立具約束力的AI安全與評估框架的持續努力。
「有很多事情值得擔憂,我認為除非我們現在就開始擔憂,否則可能會出現問題,」Hinton說。
「人們說防禦方可能比攻擊方擁有更多資源,」他在大會的一場媒體活動中補充道。「問題在於攻擊者只需成功一次,而防禦者每次都必須成功。」
Smartsheet的應對方式
對於工作管理平台供應商Smartsheet而言,AI代理違反隔離協定的事件值得關注。該公司與Anthropic維持合作夥伴關係,並在內部使用該公司的模型。
「這些關於出錯的大新聞總是讓我們處於防禦姿態,」Smartsheet專業服務賦能總監Markus McKay-Fleisch在接受採訪時表示。McKay-Fleisch負責推動AI系統在全公司的採用。
他強調,企業在不了解自身期望從代理或模型中獲取的具體價值之前,不應啟用AI系統。
「我們與IT部門做了大量工作,協助建立基礎設施以獲取其價值,」McKay-Fleisch繼續說道。Smartsheet要求希望使用AI工具的員工明確說明他們期望達成的目標——無論是效率提升、KPI影響,還是營收和成本改善。
「這往往能為IT部門提供一些安慰,」他說。「確切了解人們想用它做什麼?使用案例是什麼?」
安全的必要性
雖然企業應當清楚其具體的AI應用場景,但本週稍早揭露的OpenAI和Anthropic代理逃離事件同樣顯示,AI系統仍有大量未知之處。這些事件加劇了AI安全研究人員對標準化外部紅隊測試——即由獨立第三方對模型進行對抗性測試——的呼籲,主張在先進代理部署到真實環境之前先行實施。
「企業可能仍有限制,不願將這些東西過度深入地注入其組織的決策機制中,」AI供應商Dataiku的AI與平台資深副總裁Jed Dougherty在接受採訪時表示。
公司也應採取措施保護其資料,並僅向AI代理授予他們希望其存取的資訊,Axonis執行長Todd Barr表示。該公司開發了一個AI基礎設施平台,旨在直接對敏感資料執行AI運算。
「如果你在資料層級進行安全防護,那麼代理將永遠無法存取,甚至不知道它的存在,」Barr在接受採訪時說。他指出,大多數AI模型是在公開資料而非私有資料上訓練的,這意味著企業可以保護其資料並防止AI代理存取。他補充說,Axonis對所有進入系統的資料都進行安全防護。
「如果你將代理視為存取控制系統中的實體,然後以與存取控制系統一致的方式標記你的資料,那麼你在使用代理時應該就能處於有利位置,」Barr說。