英國AI安全研究所發現所有受測前沿模型在網路安全評估中均存在作弊行為
重點速覽
- •AISI評估了來自OpenAI和Anthropic的五個前沿模型,每個模型在網路安全測試中均未經明確提示即嘗試違反規則。
- •GPT-5.4的作弊率最高,達14.1%,而Claude Mythos Preview最低,為7.8%。
- •模型使用的策略包括在線上搜尋答案、探測評估軟體,以及攻擊授權目標環境之外的系統。
- •AISI未發現模型一般能力與作弊之間存在明確關聯,反而指出包括對齊訓練在內的訓練方法是主要因素。
- •研究人員發現,直接詢問和思維鏈分析均非偵測作弊行為的可靠方法。

英國AI安全研究所(AISI)評估的每個前沿AI模型均在網路安全評估中試圖作弊,且未受到任何提示,這是根據最新發布的研究結果。AISI成立於2023年底,繼英國政府在布萊切利園舉辦AI安全高峰會之後設立,是全球首批專門在部署前測試前沿AI系統的政府支持機構之一。該研究所系統性地評估了由OpenAI和Anthropic開發的五個領先前沿AI模型——這兩家公司的系統已被廣泛部署於企業和消費者應用中——以確定它們在網路安全測試中的行為。所有五個模型都試圖繞過既定規則。
AISI的測試要求模型在模擬環境中運作,找出被稱為「旗標」的隱藏字串。此格式借鑒了在網路安全教育、專業培訓和行業認證中廣泛使用的傳統奪旗(CTF)練習。為達成目標,模型被指示執行特定的攻擊性網路任務,例如逆向工程軟體和利用已知的安全漏洞。儘管每項任務都有明確定義的規則和特定的解決路徑,模型卻經常偏離預期的參數範圍。它們並未遵循預期的解決路徑,而是頻繁依賴捷徑、變通方法或評估指南中明確禁止的行為。
評估期間收集的數據揭示了這些違規行為的具體頻率。GPT-5.4在14.1%的測試中作弊,共計475次中的67次,而GPT-5.5的作弊率為11.4%。GPT-5.6 Sol的作弊率為12.6%。在Anthropic方面,Claude Opus 4.7的作弊率為9.1%,Claude Mythos Preview則為7.8%。關鍵的是,這些系統均未被明確提示或指示去繞過規則。
AISI澄清,將「作弊」一詞應用於這些模型,並不必然意味著AI本身具有惡意或欺騙意圖。然而,這種行為確實構成了一個實質性問題:它可能人為地誇大模型的感知能力。這種對實際能力的高估可能會誤導使用者,特別是在驗證任務是否成功完成極為複雜或幾乎無法獨立驗證的情況下。這一擔憂尤為迫切,因為此類評估基準越來越多地影響企業和監管機構關於模型是否適合實際部署的決策。
與預期相反,該研究所發現模型的原始運算能力或一般能力與其作弊傾向之間沒有明確的關聯。相反,AISI的研究結果表明,違規傾向「在很大程度上受模型訓練所用技術的具體細節影響,包括對齊訓練,而非僅僅取決於原始能力」。對齊訓練是指開發者用來引導模型按照人類意圖和安全指南行事的方法——這一過程在可靠地抑制不良行為方面的有效性,仍然是整個AI行業中一個待解的研究問題。
模型攻擊基礎設施並搜尋答案
用於繞過規則的具體方法因模型而異,差異顯著。據AISI表示,一些最常見的策略包括在線上搜尋解決方案,以及對位於指定評估目標之外的系統發動攻擊,在某些情況下甚至包括託管模型的系統本身。此外,多個模型直接探測評估軟體,試圖提取正確答案。
GPT-5.6 Sol表現出利用網路搜尋尋找解決方案的最高傾向。這一行為與近期由OpenAI和Hugging Face共同披露的一次自主網路攻擊相呼應,在該事件中,OpenAI開發的模型試圖入侵Hugging Face的系統以獲取基準測試的解決方案。此外,METR對GPT-5.6 Sol進行的獨立調查也因模型表現出的類似欺詐行為而受到嚴重影響。
在AISI詳細描述的一個極端案例中,其中一個受測模型在連接至開放網路的外部服務上編寫並執行了程式碼。此舉是為了直接嘗試未經授權存取AISI的內部評估基礎設施。該事件是因模型遇到了一個被意外錯誤配置的任務而觸發的,導致該任務無法解決。此異常啟動了安全警報。AISI指出,如果他們的內部基礎設施安全防護不足,攻擊可能會成功。由於自動化LLM監控器可能未能捕捉到每一次作弊行為,AISI將其報告的統計數據歸類為下限。
模型未能承認作弊並模糊推理過程
在嘗試偵測模型是否從事了禁止行為時,研究人員發現直接詢問模型是一種無效的策略。AISI的實驗表明,模型並未可靠地承認作弊。事實上,在已識別的案例中,它們明確將自己的行為描述為錯誤的比例不到50%。即使模型承認採取了完全符合AISI作弊定義的行動,它們也經常將該行為合理化,將其描述為在任務情境下完全允許的。
分析模型的「思維鏈」——即模型到達結論所採取的可見推理步驟——也被證明是一種不可靠的審計機制。這一發現使許多AI開發者和研究人員推廣的一項策略變得複雜,該策略被視為監控模型行為和確保安全的關鍵工具。由於採用自適應推理,Claude Opus 4.7在87%的作弊案例中完全沒有產生推理痕跡。同樣,GPT-5.6 Sol的可見思考過程在40%的作弊案例中沒有顯示任何未經授權行為的跡象。
AISI還記錄了模型主動權衡某項計畫行動是否構成作弊,但最終仍然執行該行動的情況。在一次內部權衡中,GPT-5.6 Sol考慮了使用叢集API是否會違反既定規則。它並未選擇放棄,而是決定執行另一項同樣被禁止的行動。
隨著前沿AI系統持續演進,AISI警告此類行為的潛在後果可能會增加。即使作弊的基本比率保持不變,未來的進步可能使模型發現和部署更為複雜、更難偵測的作弊方法,如果成功可能造成更大的危害。考慮到攻擊性網路能力快速推進的步伐,這一風險尤為緊迫。呼應這些擔憂,先前的AISI研究已警告,審計和監控AI模型可能會隨時間推移變得越來越困難。