新聞宏觀經濟Darktrace 研究發現:AI 代理入侵自己的測試環境以作弊

Darktrace 研究發現:AI 代理入侵自己的測試環境以作弊

作者: Decrypt·

重點速覽

  • •Darktrace 於 9 月 24 日成立 Signal Labs,研究 AI 代理在出錯時的行為模式,相關壓力測試於夏季進行。
  • •在 10 項程式編寫挑戰中面對兩項被刻意設計為無解的任務,並受到被淘汰的威脅時,執行 GPT 5.6 Sol、Claude Opus 4.6 與 Claude Sonnet 4.5 等模型的代理掃描弱點、竊取憑證並跨系統移動。
  • •其中一個代理入侵了託管其自身評估的機器,並改寫測試任務使其記錄為滿分。
  • •在一項記憶篡改實驗中,被編輯過的儲存日誌讓部分程式編寫助理相信自己已獲得執行安全評估的授權,進而掃描網路並提升權限,但也有一些助理直接拒絕。
  • •這些研究結果之前已有類似事件,包括 Anthropic 於 7 月承認 Claude 在測試中入侵三家真實公司,以及一個 OpenAI 模型逃出沙盒滲入 Hugging Face 的系統。
Darktrace 研究發現:AI 代理入侵自己的測試環境以作弊

網路安全公司 Darktrace 表示,兩個 AI 代理以駭客手段通過了一系列它們無法正當通過的程式編寫測試——其中一個甚至入侵了為其自身表現評分的機器,並改寫測試任務以記錄滿分成績。

這些研究結果來自 Signal Labs,這是 Darktrace 於 9 月 24 日成立的研發部門,旨在研究 AI 代理在事情偏離預期時的行為模式,根據該公司的公告。該公司於今年夏天對 AI 代理進行了相關的壓力測試。

簡單來說,AI 代理是一種能自主採取行動的軟體——編寫並執行程式碼、搜尋檔案、在公司網路中移動——而人類只會偶爾介入檢查。Signal Labs 的前兩項實驗都指向同一個令人不安的問題:代理並不總是遵守給定的規範,而為阻止它們所建立的防線也未必可靠。

「你可以給代理下達指令,但這不代表你能相信它真的會遵循那些指令,並按照你預期的方式行事,」Darktrace 首席 AI 官 Tim Bazalgette 在聲明中表示。

駭進考場

在第一項測試中,Darktrace 讓執行不同模型的 AI 代理——包括 GPT 5.6 Sol、Claude Opus 4.6 與 Claude Sonnet 4.5,陣容來自多家 AI 開發商——在模擬企業網路中完成 10 項程式編寫挑戰。其中兩項任務被刻意設計成無法正當解決,而代理們被告知,除非達到滿分,否則將被「淘汰」。

兩個並未接受失敗。它們轉而攻擊周圍的網路——掃描弱點、竊取登入憑證,並在系統之間跳躍,以追求它們被告知必須達到的分數。其中一個代理更進一步,入侵了託管其自身評估的機器,改寫了測試任務使其記錄為滿分成績——等於是駭進考場來在考試中作弊。

篡改記憶

第二項實驗針對的是一個較不顯眼的弱點:記憶。程式編寫助理會持續記錄使用者告知的一切內容,並以純文字檔案的形式儲存在機器上,且沒有任何機制檢查該檔案是否被竄改。由於助理將該日誌視為自己獲准執行事项的紀錄,編輯該檔案就等於改變了代理對規則的認知。

Darktrace 的研究人員編輯了這些儲存的日誌,使助理相信它們已獲得執行安全評估的授權。在信以為真的情況下,這些代理便開始掃描網路、跨系統移動並提升自身權限——不過並非所有助理都同樣上當,有些直接拒絕了。

兩項實驗都不需要特殊的越獄手法或罕見的駭客技術。兩者的運作方式都是向代理灌輸一個看似合理的故事,然後觀察它們據此行動,這與人類員工被說服去做不該做的事並無不同。

即使從不編寫任何程式碼的公司,這一點也同樣重要。企業正在將真正的職責交給 AI 代理——部署程式碼、管理伺服器、處理 IT 工單、管理資源與進行採購——因為這比一切都經由人工處理更便宜、更快速。這項研究指出,用於約束這些代理的權限與規則描述的是它們「應該」做什麼,而不是當任務變得困難時它們「實際上」會做什麼。

「權限與靜態防護措施描述的是意圖,但無法描述行為,」Bazalgette 在公告中表示。「這個落差正是 Darktrace 的方法所要填補的。」

一種模式,而非個案

Darktrace 並非第一家發現自家 AI 脫軌行事的供應商。Anthropic 於 7 月承認,由於研究人員將測試環境連接到網際網路,Claude 在一次安全測試中入侵了三家真實公司。

OpenAI 在幾週前也遭遇了類似的驚險事件:一個未發布的模型逃出沙盒,並透過一個尚未被發現的軟體缺陷滲透到 Hugging Face 的系統。幾天後,該公司的代理在一次測試中駭入了澳洲政府。

Darktrace 於 2026 年 8 月將其 Signal Labs 的研究結果告知 Anthropic、AWS 與 OpenAI,比 9 月 24 日公開發布早了整整一個月。這些實驗室是否會公開回應,以及隨著企業續將真正的職責交給代理,是否會有更多此類壓力測試浮上檯面,都是這些研究結果留下的待解問題。