Anthropic 的 Opus 5 在瀏覽器代理測試中達成提示注入攻擊成功率零%
重點速覽
- •Opus 5 在 129 個瀏覽器代理測試情境中達成提示注入攻擊成功率零%,但前提是必須啟用 Auto Mode 防護。
- •若沒有 Auto Mode 的分層防禦,Opus 5 對提示注入的受攻擊率為 3.7%,高於 Sonnet 5 在相同未受保護設定下的 0.93%。
- •安全公司 Gray Swan 的獨立測試發現,Opus 5 將 15 次嘗試後的攻擊成功率,從 Opus 4.8 的 5.5%降至 2.0%。
- •Auto Mode 透過兩個獨立層級防禦提示注入:掃描傳入資料中的隱藏指令,並在危險操作執行前予以阻止。
- •Anthropic 的結果特別適用於其自有生態系,未必能推廣至缺乏同等分層防禦的第三方部署。

Anthropic 表示,其最新模型 Opus 5 在自有軟體生態系中,幾乎不受提示注入攻擊影響。提示注入是一種攻擊手法,攻擊者透過被操縱的輸入,例如嵌入網頁中的隱藏文字,繞過 AI 模型的操作指令;在幾乎所有測試情境中,這類攻擊都未能成功影響 Opus 5。
根據 Opus 5 系統卡,在 129 個測試情境中,瀏覽器代理的攻擊成功率達到零%。這與 OpenAI 於 12 月承認提示注入可能永遠無法完全解決形成明顯對比。
在安全公司 Gray Swan 進行的一般提示注入評估中,15 次嘗試後的成功率從 Opus 4.8 的 5.5%降至 Opus 5 的 2.0%;相關細節載於系統卡的安全測試章節。
不過,瀏覽器代理達成零%的結果,取決於在 Claude Cowork 等產品中啟用 Auto Mode。Auto Mode 部署了兩層防禦:一層會在模型處理資料前,掃描傳入資料中的隱藏指令;另一層則會在執行前阻止危險操作。攻擊者必須分別突破這兩層防線才可能成功。
如果沒有這些保護措施,Opus 5 對提示注入的受攻擊率為 3.7%。值得注意的是,在相同未受保護的設定下,Sonnet 5 表現更好,比例為 0.93%。只有將 Opus 5 模型與 Auto Mode 防護軟體結合,才能在瀏覽器代理情境中把攻擊成功率降至零。
提示注入一直被廣泛視為 AI 代理面臨的重大安全挑戰之一。AI 代理是可代表使用者瀏覽網頁、閱讀文件並採取行動的自主系統。由於這些代理會經常處理不受信任的外部內容,惡意行為者可能在其中嵌入指令,以覆寫代理原本的指令。這項漏洞長期以來都是整個 AI 產業的持續隱憂,也是代理式 AI 系統更廣泛部署的主要障礙。包括 Google 和 OpenAI 在內的大型 AI 實驗室也在開發瀏覽器代理產品;隨著這些工具朝更廣泛的消費者與企業用途推進,提示注入防護能力正成為競爭差異化因素。Anthropic 的結果顯示,將模型層級的訓練改進與架構性防護欄結合,可以降低風險;不過,這些發現特別適用於 Anthropic 自有生態系,未必能推廣至缺乏同等分層防禦的第三方部署。