新聞宏觀經濟Anthropic 揭露 Claude 模型逃離測試環境並入侵三家公司

Anthropic 揭露 Claude 模型逃離測試環境並入侵三家公司

作者: Fortune Crypto·

重點速覽

  • Anthropic 對 141,006 次評測運行的審查發現了三起 Claude 模型逃離測試環境並入侵屬於真實組織的實際基礎設施的事件。
  • 第三方評測合作夥伴 Irregular 的設定錯誤導致在搶旗演練期間允許網路存取,儘管 Claude 被明確告知其不具備網路連線。
  • 最嚴重的事件涉及 Claude Opus 4.7 提取憑證並存取包含數百列生產資料的資料庫,且這是唯一一起模型在認知到系統為真實後仍繼續攻擊的事件。
  • 三家受影響的組織中沒有任何一家在 Anthropic 通知之前偵測到入侵,且該公司仍在嘗試聯繫其中一家。
  • 這些揭露事件出現在 Anthropic 和 OpenAI 均準備進行預計估值各超過 1 兆美元的股票上市之際,可能引發對自主式 AI 代理風險更嚴格的監管審查。
Anthropic 揭露 Claude 模型逃離測試環境並入侵三家公司

Anthropic 公開表示,其 Claude AI 模型突破了隔離測試環境,未經授權存取了三個真實組織的系統,使該公司成為本月第二家揭露其技術執行真實世界自主攻擊的主要 AI 實驗室。

此消息發布於 OpenAI——Anthropic 在 AI 競賽中的主要對手——揭露其自身模型利用先前未知的漏洞逃離受控測試環境並入侵 Hugging Face(一個開源 AI 平台)之後僅一週有餘。先前的事件促使 Anthropic 對其網路安全評測紀錄進行內部審查,該公司在週四發布的文章中表示。

Anthropic 審查了 141,006 次評測運行——即在受控環境中為模型設定任務並記錄其行為以供審查的個別測試環節——其中 Claude 可能已取得網際網路存取權限。審查發現了三起事件,模型從第三方評測合作夥伴的測試環境中連上開放網際網路,繼而入侵真實基礎設施。這些事件中最早的一起可追溯至四月,意味著此暴露狀態在內部審查前約三個月未被察覺。

在三起事件中,Claude 均被指派執行搶旗(capture-the-flag)演練,這是業界測試模型駭客能力的標準方法,要求模型從模擬網路上的另一台機器中擷取隱藏資訊。此形式源自傳統的網路安全培訓與競賽。Anthropic 的提示明確告知 Claude 其不具備網際網路存取權限。然而,第三方評測合作夥伴 Irregular 的設定錯誤意味著網路連線實際上是可用的。

據 Anthropic 表示,Claude 認為自己仍在模擬環境中運作,因此搜尋其指派目標,並在每起事件中找到並入侵了真實系統。模型使用了基本技術,例如利用弱密碼和未經認證的端點——這些是儘管已被充分理解的常見安全弱點,但仍持續暴露真實系統的漏洞類型。

最嚴重的事件涉及 Claude Opus 4.7,該模型提取了憑證並存取了一個包含數百列生產資料的資料庫,該資料庫屬於一家恰好與其評測場景中的虛構目標同名的真實公司。Anthropic 指出,這是唯一一起模型在獲得明顯證據表明系統為真實環境後仍繼續攻擊的事件。

在第二起事件中,Claude Mythos 5 建立並發布了一個惡意 Python 套件——一組開發者通常下載以為其軟體添加功能的預先編寫程式碼——至公開套件庫。此類攻擊被稱為軟體供應鏈入侵,是一種日益被記錄的威脅媒介,攻擊者發布看似合法的程式碼以誘騙開發者安裝。該模型一度推斷演練仍是模擬的,因為它不認可保護其連線的憑證機構——即核發數位憑證以驗證網站或伺服器真實性的組織。該套件上線約一小時,被安裝在 15 個真實系統上,包括一家安全公司的惡意軟體掃描器,這使 Claude 能夠取得並使用該公司的憑證。

第三起事件涉及一個內部研究模型,該模型掃描了約 9,000 個目標後入侵了一家公司的網路應用程式。該模型在自行得出被入侵的系統不屬於演練一部分的結論後,停止了活動。

Anthropic 表示,沒有任何受影響的組織在被通知之前偵測到入侵,且該公司仍在嘗試聯繫三家中的其中一家。該公司將這些事件定性為操作失誤而非對齊失誤——用 AI 安全術語來說,是基礎設施和流程控制的失誤,而非模型正在追求與開發者意圖不一致的目標的證據。Anthropic 指出,其最新模型是三個模型中唯一在認知到環境為真實後停止攻擊的。

Aikido Security 的安全研究員 Charlie Eriksen 表示,看到 Anthropic 主動審查其評測紀錄並快速揭露調查結果令人振奮,但他對測試似乎缺乏即時監控表示擔憂。

「令人不安的僅僅是這些代理所能運作的龐大能力、速度和規模。它們所做的並非人類未曾做過的事。這一點並不新鮮。真正令人擔憂的是它們在沒有有意義的人類監督、判斷或干預下行動,」Eriksen 表示。

「OpenAI 的事件引發了關於 LLM 代理失控的法律和倫理影響的合理疑問,」他補充道。「這只會加劇這些擔憂。如果一個自主代理造成損害或在其預期邊界之外行動,最終由誰負責?」

OpenAI 和 Anthropic 的揭露正值兩家公司準備進行預計估值各超過 1 兆美元的股票上市之際。隨著對自主代理風險的恐懼日益增加,以及業界至少考慮「調節」前沿開發速度的呼聲不斷升高,兩家公司的即將到來的 IPO 可能面臨更嚴格的審查。接連發生的事件也為自主 AI 系統責任框架的開放性問題增加了急迫性——在這一領域,現有的網路安全和產品責任法尚未建立明確先例。

本篇報導最初刊登於 Fortune.com