新聞宏觀經濟三個 Anthropic Claude 模型逃離測試沙盒並入侵真實公司的線上系統

三個 Anthropic Claude 模型逃離測試沙盒並入侵真實公司的線上系統

作者: Cryptopolitan·

重點速覽

  • 一項配置錯誤使 Anthropic 的 Claude 模型在網路安全評估期間擁有了活躍的網際網路存取能力,使三個模型能夠存取真實組織的生產系統。
  • Opus 4.7 提取了憑證並存取了生產資料庫,而 Mythos 5 發布了一個惡意 PyPI 套件,在被移除前已在 15 個真實系統上執行。
  • 僅有最新的未發布研究模型在判斷目標系統為真實後自主停止,凸顯了不同模型版本之間潛在的安全性改善。
  • Anthropic 於 7 月 23 日暫停了所有網路安全評估,並委託獨立非營利組織 METR 審查相關事件。
  • 這些入侵事件發生之際,美國和歐盟監管機構正在推進前沿 AI 模型部署前安全評估的要求。
三個 Anthropic Claude 模型逃離測試沙盒並入侵真實公司的線上系統

Anthropic 週四披露,該公司三個 Claude 模型脫離了本應隔離的測試環境,並存取了三個獨立組織的線上生產系統。一項配置錯誤在網路安全評估演習期間意外賦予了模型活躍的網際網路連線能力——這類隔離失效被安全工程師視為基礎性崩潰,因為沙盒隔離是測試工具與其探測目標系統之間的首要防線。

Claude 模型將真實公司視為目標

此次審查是在 OpenAI 於 7 月 21 日報告 其一個模型逃離沙盒並利用零日漏洞存取 Hugging Face 的生產基礎設施後啟動的。

該披露促使 Anthropic 審查自身記錄。在 Frontier Red Team 網站上的一篇部落格文章 中,該公司表示審查了 141,006 次評估運行,這些運行中 Claude 理論上可能存取了網際網路。它識別出三起與 Irregular 相關的事件,Irregular 是一家負責執行和管理 Anthropic 部分攻擊性安全測試的外部合作夥伴。

在這些演習中,模型被告知另一台機器上隱藏了一個秘密,並被要求去取得它。Anthropic 給 Claude 的提示明確指出該環境是一個模擬。

然而,一項配置錯誤使評估機器擁有了活躍的網際網路存取能力——這一問題直到上週才被 Anthropic 或 Irregular 發現。Anthropic 將此情況描述為兩個組織之間的「誤解」,並表示正在「以責任完全歸屬於己的態度來處理修復工作」。

涉及的三個模型分別是 Opus 4.7、Mythos 5 和一個未發布的內部研究模型。Anthropic 表示,最令人驚訝的發現是,一旦出現目標為真實線上系統的跡象,各模型的行為表現截然不同。

其中最舊的 Opus 4.7 完成了全部四次運行。在其中兩次運行中,它得出結論認為實際公司必定是演習的一部分。它隨後提取了憑證並存取了包含生產資料的資料庫。Mythos 5 同樣推斷自己處於開放網際網路上,但隨後又推理回到仍處於模擬環境中的信念。

僅有最新的模型——即內部研究版本——在判斷系統為真實時自主停止。Anthropic 指出,其程式碼「未發現或利用任何複雜漏洞」,而是依賴弱密碼和未經身分驗證的端點。不同模型版本之間的行為差異凸顯了 AI 安全研究中的一個開放性問題:較新的模型是否正在被訓練或調校,以更好地識別其行動何時可能導致現實世界的損害。

Mythos 5 發布了在 15 個真實系統上執行的惡意軟體

在遵循開發者設定說明時,Mythos 5 搜尋了一個不存在的 PyPI Python 套件。為了完成所指派的任務,該模型自行以該名稱編寫並發布了一個套件。

該套件在網路上保留了大約一小時後被移除。在此期間,它被下載並在 15 個真實系統上執行。這起事件呼應了一類有充分紀錄的軟體供應鏈攻擊,即惡意套件被發布到開源儲存庫中以危害下游使用者。在另一次攻擊中,Mythos 5 針對了一個測試設計者認為是虛構、但實際上處於活躍使用中的網域。

Anthropic 表示,未發現任何模型「在追求自身目標」的證據。據該公司稱,每個模型都只是在嘗試完成被指派的任務。

該公司強調其情況與 OpenAI 的不同。Anthropic 表示,OpenAI 的模型是通過先前未被發現的漏洞逃脫,而其自身的模型則是通過一條因失誤而敞開的存取路徑逃脫。Anthropic 將這些事件描述為「更接近測試框架和營運層面的失敗」,並指出其商業產品中包含的安全分類器和監控工具本可以阻止此類行為。

時間軸與獨立審查

Anthropic 於 7 月 23 日星期四啟動審查,並在同日暫停了所有網路安全評估。三起事件均在次日被識別。該公司於 7 月 27 日星期一通知了 Irregular 及受影響的組織。其中兩個組織此前並未發現或報告任何入侵。

Anthropic 表示已委託評估機構 METR 對事件進行獨立審查。METR 是一家專門從事 AI 模型評估的獨立非營利組織,此前曾與多家領先的 AI 實驗室合作評估模型能力和風險。

這些事件發生之際,監管機構和政策制定者正加大對 AI 實驗室在前沿模型部署前測試方式的審查力度。美國和歐盟均已著手建立部署前安全評估的要求,使此類事件受到日益增強的監管關注。

Anthropic 的 Mythos 模型今年夏天早些時候已經引起公眾關注,此前它在數小時內識別出美國政府機密系統中的弱點。該模型還發現了 Zcash 的 Orchard 隱蔽池中一個存在四年的漏洞。