英美AI研究機構發現月之暗面的Kimi K3在網路攻擊能力上落後美國前沿模型
重點速覽
- •Kimi K3在ExploitBench漏洞開發基準測試中得分32%,遠低於領先美國模型的76.2%平均分,且在41個測試漏洞中未能達成任何任意程式碼執行。
- •在模擬企業網路入侵測試中,Kimi K3在十次嘗試中僅有一次完成完整的32步入侵鏈條,而最佳美國模型成功了六到七次。
- •該模型未拒絕攻擊性網路任務,評估人員警告其7月27日的開放權重發布將允許任何下游使用者移除護欄並在不受監督的情況下重新部署該模型。
- •儘管Kimi K3在通用基準測試中成績優異,其網路能力表現不佳可能源於使用了Anthropic模型的輸出進行蒸餾,而這些模型會封鎖攻擊性網路提示,因此提供的相關訓練資料有限。
- •該評估是政府支持的安全機構在前沿AI模型公開發布前進行預發布評估的新興做法的一部分。

英國AI安全研究所(AISI)與美國AI標準暨創新中心(CAISI)的聯合評估發現,月之暗面(Moonshot AI)的Kimi K3在構建軟體漏洞利用程式和執行模擬網路攻擊方面,落後於領先的美國AI系統。兩個機構於7月23日公布了調查結果,正值月之暗面計劃於7月27日發布該模型完整開放權重之前。此次評估是政府支持的安全機構在前沿模型公開發布前進行預發布評估的更廣泛趨勢的一部分。
根據報告,Kimi K3的安全防護措施並未阻止其協助攻擊性網路行動。評估人員表示:「Kimi K3在接到指令並獲得初始網路存取權限後,能夠自主攻擊小型、防護薄弱且脆弱的企業系統。」
ExploitBench測試結果
兩個機構使用ExploitBench對Kimi K3進行了測試。ExploitBench是由卡內基美隆大學設計的基準測試,用於衡量模型將軟體漏洞利用推進至完成的有效程度。該基準測試基於2023年後在Chrome的V8引擎中發現的41個漏洞。ExploitBench等基準測試已成為AISI及類似機構用於產生可比較、可重現的模型風險測量結果的標準工具。
Kimi K3在該基準測試中得分32%。領先的美國模型平均得分76.2%,而中國的GLM-5.2得分24%。
任意程式碼執行——該基準測試中最嚴重的結果——使攻擊者能夠完全控制目標機器。美國模型在41項任務中平均達成了20項的任意程式碼執行。Kimi K3則一項都未達成。GLM-5.2同樣未能達到該門檻。儘管Kimi K3目前在開放權重競爭者中處於通用網路能力的領先地位,但在實際攻擊造成最大損害的階段,它卻表現不足。
模擬網路入侵測試
第二項評估名為「The Last Ones」,將模型置於一個包含約20台主機、分布於四個子網路的模擬企業網路中。完成完整的32步入侵路徑需要人類專家約20小時。
Kimi K3平均推進到第17步。能力最強的美國模型平均達到28.5步,GLM-5.2達到11步。然而,評估人員指出,Kimi K3在十次嘗試中有一次完成了整個鏈條,且未超過測試設定的1億token上限。表現最佳的美國模型在十次中完成了完整鏈條六到七次。
各機構將Kimi K3唯一一次成功的運行解讀為該模型具備底層能力的證據,但無法按需穩定重現。他們還指出,模擬環境中沒有主動防禦者,並包含一條通往目標的內建路徑,這些條件從根本上對任何攻擊者都有利。
安全防護隱患與開放權重風險
評估人員強調,該模型在執行攻擊性任務時不會拒絕,這是一項重大風險。AISI此前曾警告,開放模型能力的提升會帶來「持續且不可逆的濫用風險」。一旦Kimi K3的權重於7月27日公開發布,該模型的行為將無法再由託管方加以限制。與開發者可以更新安全防護或撤銷存取權限的封閉或僅API系統不同,開放權重發布意味著任何下游使用者都可以移除護欄並在不受監督的情況下重新部署該模型。
完整的初步評估可在AISI網站上查閱。
通用效能與網路能力之間的差距
在此報告之前,Kimi K3在通用基準測試中展現了強勁的成績——這一紀錄至今未變。這個擁有2.8兆參數的中國模型據報導優於Anthropic的Claude 4.8和OpenAI的GPT-5.5,並在多個排行榜上名列前茅。
各機構認為,這種效能差距可能源於該模型的訓練方法。7月22日,白宮科學主任Michael Kratsios指控月之暗面通過使用Anthropic的Fable模型的輸出作為訓練資料來進行蒸餾。蒸餾——即使用更具能力的模型的輸出來訓練另一個模型——在業界相當普遍,但可能會同時傳播源模型的優勢和不足。Anthropic的分類器會封鎖高級攻擊性網路提示,這意味著從Claude回覆中抓取的訓練資料集在這些特定技能方面將包含有限的材料。Kimi K3缺乏此類分類器,這使其能夠在通用任務上匹敵西方模型,但在漏洞利用開發方面仍然表現不佳。