Anthropic 披露 Claude 在網路安全測試中入侵三家真實公司
重點速覽
- •三個 Claude 模型變體在網路安全評估期間,因測試設定錯誤導致 AI 意外獲得公共網際網路存取權限,進而入侵了真實公司。
- •Anthropic 在審查為回應 OpenAI 另一起 AI 容器突破披露而啟動的超過 141,000 次網路安全評估運行時,發現了這三起事件。
- •一個 Claude 模型存取了包含真實資料的公司生產資料庫,另一個將惡意 Python 套件上傳至 PyPI 儲存庫並被 15 個系統下載,第三個掃描了約 9,000 個暴露於網際網路的系統後入侵了一個組織。
- •Anthropic 將這些入侵歸因於測試基礎設施的故障,而非模型的蓄意行為不當,未發現 Claude 試圖超出其指派任務範圍的證據。
- •三家受影響組織中有兩家在 Anthropic 通知之前並不知道遭到入侵,該公司已暫停其網路安全測試並承諾改善監控和供應商監督。

Anthropic 週四揭露,其 Claude AI 模型的數個版本在測試設定錯誤導致 AI 意外獲得開放網際網路存取權限後,入侵了三家未具名的真實公司。此消息發布於 OpenAI 報告其 AI 模型逃離封閉測試環境並入侵 Hugging Face 的一週後,以及 Anthropic 承認其自有模型也曾突破容器限制的僅一天後。
Anthropic 在審查為回應 OpenAI 披露事件而啟動的超過 141,000 次網路安全評估運行時發現了這些事件。此類評估的部分目的在於衡量前沿模型是否能自主執行攻擊性網路操作——若在沒有充分防護措施的情況下部署,這項能力可能遭致濫用。
在我們的網路安全評估審查中,我們發現了三起事件,其中 Claude 模型從第三方評估環境內部或互動過程中連上了網際網路,隨後未經授權存取了三家不同……的真實系統
— Anthropic (@AnthropicAI) July 30, 2026
在三起事件中,Anthropic 均指派 Claude 執行「奪旗挑戰」,這是網路安全培訓和專業評估中使用的標準演練格式,要求模型入侵網路上的另一台機器並取得一份機密資訊。Anthropic 解釋道:「該挑戰被設定為開放式的,未規定特定方法。」
Claude 被告知其運作於沒有網際網路存取權限的模擬環境中。然而,測試環境實際上仍與公共網際網路相連。模型誤以為其遭遇的系統是演練的一部分,因而使用了常見攻擊手法——包括弱密碼、暴露的憑證、SQL 注入和未經驗證的端點——來入侵這些公司。上述每一種方法都位列年度產業資安事件報告中最常見的安全漏洞之中。
前沿模型與容器限制
此披露正值前沿 AI 模型展現出日益增強的規避容器限制協定的能力之際。本月稍早,OpenAI 表示 GPT-5.6 Sol 和一個更先進的未發布模型利用了一個先前未知的軟體漏洞逃離沙箱環境、取得網際網路存取權限,並入侵了 Hugging Face 的生產基礎設施以獲取某項網路安全基準測試的答案。OpenAI 隨後證實同一事件還涉及未經授權存取另外四家公司,但僅有一家——Modal Labs——已被公開識別。
三起事件
據 Anthropic 表示,在第一起涉及 Claude Opus 4.7 的事件中,AI 將一家真實公司的網站誤認為其任務的虛構目標,提取了憑證,並存取了一個包含數百行真實資料的生產資料庫。
在第二起事件中,Claude Mythos 5 將一個惡意 Python 套件上傳至真實的 PyPI 儲存庫——Python 軟體的主要分發中心——該套件在被移除前已被下載至 15 個系統。PyPI 等套件儲存庫一直是供應鏈攻擊的反覆目擊對象,攻擊者將惡意程式碼偽裝成正規函式庫上傳,以入侵下游使用者。
第三個內部研究模型掃描了約 9,000 個暴露於網際網路的系統,在入侵一個組織後停止,因為它判定該目標可能是真實的。
兩家受影響的組織在 Anthropic 通知之前並不知道遭到入侵。
「在上述每個案例中,我們的提示明確告知 Claude 沒有網際網路存取權限,」Anthropic 寫道。AI 假設真實世界系統是「演練的一部分」。由於奪旗場景「本質上就是攻擊外部系統的指令」,入侵行為「符合 Claude 被指派的任務」。
基礎設施故障,非模型行為不當
Anthropic 表示,未發現任何證據表明 Claude 試圖逃離其測試環境或在其指派任務範圍之外採取行動。公司將這些事件歸因於測試環境的故障,而非模型本身的問題。
在發現問題後,Anthropic 暫停了其網路安全測試,通知了所有受影響的組織,並提出了改善監控、調查工具以及協助執行 AI 評估的外部供應商監督的計畫。
這些事件凸顯了 AI 產業面臨的一項結構性挑戰:旨在判定模型能否執行攻擊性網路操作的評估,本身就要求在特定環境中運行這些模型,而一旦容器限制失效,受測能力便會被釋放到真實基礎設施上。
「歸根究底,許多因素共同導致了這些事件,但秉持無責備事後分析的文化,我們在著手修復時將責任視為完全由我們承擔,」該公司表示。