新聞宏觀經濟Kimi K3 在網路漏洞利用測試大幅落後美國前沿模型;蒸餾指控或可解釋原因

Kimi K3 在網路漏洞利用測試大幅落後美國前沿模型;蒸餾指控或可解釋原因

作者: The Decoder·

重點速覽

  • Kimi K3 的內建防護未能阻止進攻性網路行動,且該模型在漏洞利用開發中未加以拒絕並提供協助。
  • 在 ExploitBench 上,Kimi K3 的完成率為 32.2%,低於領先美國模型的 76.2%,並且在 41 項任務中從未達到最高漏洞利用層級 Arbitrary Code Execution。
  • Kimi K3 在十次嘗試中完成了一次完整的 32 步模擬網路攻擊路徑,顯示它具備該能力,但無法可靠地重現。
  • CAISI 的時間序列分析顯示,截至 2025 年,中國開放權重模型在網路能力上仍落後美國前沿系統四到七個月。
  • Kimi K3 一般基準分數強勁但網路表現偏弱,支持其由 Anthropic 的 Fable 蒸餾而來的指控;Fable 的安全分類器會阻擋進攻性網路查詢出現在訓練資料中。
Kimi K3 在網路漏洞利用測試大幅落後美國前沿模型;蒸餾指控或可解釋原因

Kimi K3 在網路漏洞利用測試大幅落後美國前沿模型;蒸餾指控或可解釋原因

英國 AI Security Institute(UK AISI)與美國 Center for AI Standards and Innovation(CAISI)的一項聯合評估發現,Moonshot AI 最新模型 Kimi K3 會在缺乏實質阻力的情況下協助進攻性網路行動。Moonshot AI 由楊植麟於 2023 年創立,投資方包括 Alibaba 與 Tencent,是中國最受關注的 AI 新創公司之一。雖然 Kimi K3 在進攻性網路任務上大幅落後領先的美國前沿模型,但其表現優於中國的 GLM-5.2,並在開放權重模型中樹立了新的基準。

該模型的內建防護未能阻止漏洞利用開發或進攻性網路行動,且模型在兩方面都未加以拒絕並提供協助。這項評估由 UK AISI 與 NIST/CAISI 發布。

ExploitBench:Kimi K3 未能達到最困難層級

這些機構使用由 Carnegie Mellon University 開發的基準測試 ExploitBench,評估模型的漏洞利用開發能力。ExploitBench 使用 2023 年後在 Chrome V8 引擎中發現的 41 個漏洞,衡量模型能在軟體漏洞利用流程中推進到何種程度。

領先的美國模型平均完成率為 76.2%,相比之下 Kimi K3 為 32.2%,GLM-5.2 為 24.4%。關鍵的是,Kimi K3 在 41 項任務中,沒有任何一項達到最高漏洞利用層級——Arbitrary Code Execution(ACE)。ACE 被視為最嚴重的漏洞利用層級,因為它會讓攻擊者取得目標系統的完全控制權。領先的美國模型在 41 項任務中有 20 項達到 ACE。

對於美國閉源權重模型,這些機構停用了系統層級防護,以衡量其最大能力。這些防護在公開可用版本中仍然啟用。

模擬網路攻擊:Kimi K3 達到半程

第二項評估名為「The Last Ones」(TLO),模擬一次企業網路攻擊,涉及橫跨四個子網路、約 20 台主機的 32 步攻擊路徑。根據這些機構的說法,人類專家約需 20 小時才能完成這項演練。

只有少數模型能完整解決 TLO。截至目前,已有四個公開可用的閉源權重模型通過此測試,其中最強者在十次嘗試中可成功六到七次。

Kimi K3 平均達到 32 步中的第 17 步,相比之下,領先美國模型為 28.5 步,GLM-5.2 為 11 步。Kimi K3 在十次嘗試中有一次完成整個攻擊路徑,且仍維持在 100 million token 限制內,顯示它具備這項能力,但無法可靠地調用。

該機構寫道:「Kimi K3 is capable of autonomously attacking small, weakly defended and vulnerable enterprise systems, when directed to do so and given initial network access,」。

TLO 並未納入主動防禦措施,因此並非完全符合現實。不過,這些結果在真實情境中仍會引發警訊。本週稍早出現一個值得注意的案例:OpenAI 模型試圖自主入侵 Hugging Face。Hugging Face 成功擊退攻擊,但這需要大量投入,並部署了開放權重模型。

中國模型正在縮小差距,但仍然落後

CAISI 進行了一項時間序列分析,使用基於 Elo 的尺度追蹤自 2025 年初以來美國與中國模型的網路能力。兩條趨勢線都在上升,但中國模型始終落後於美國對手。

在先前的一項分析中,英國機構估計開放模型的表現差距為四到七個月,相比之下,2025 年初為六到十個月。最新結果與這一模式一致:中國開放權重模型正在進步,但仍遠落後於領先的美國系統。

AISI 警告,這一差距不應造成自滿。開放模型日益增強的網路能力造成該機構所稱的「a persistent and irreversible risk of misuse.」。不同於可由供應商遠端更新或限制的閉源權重模型,開放權重模型一旦被下載,開發者就無法撤銷其能力或修補其防護。

網路測試結果與蒸餾指控一致

Kimi 的相關發現也強化了針對中國模型開發者的蒸餾指控。蒸餾是一種技術,即用能力更強模型的輸出來訓練另一個模型,使其能在無需存取教師模型底層權重或訓練資料的情況下近似其能力。美國科學顧問 Michael Kratsios 最近指控 Moonshot AI透過使用 Anthropic 的 Fable 最佳輸出作為訓練資料來提升 Kimi K3 表現,從而「distilling」Anthropic 的 Fable。Kratsios 也聲稱 Moonshot AI 曾取得 Nvidia 的 GB300s,而該產品受美國出口管制。Anthropic 已發布 Fable 的防護框架。

Kimi K3 一般基準分數強勁但網路表現偏弱,其中一種解釋是,該模型可能主要使用涵蓋一般知識、程式設計與代理任務的 Claude 輸出進行訓練。Anthropic 的安全分類器會特別阻擋進階進攻性網路查詢,這意味著此類輸出在任何由 Claude 回應建構的蒸餾資料集中都會被低度代表。因此,Kimi K3 可能在標準基準測試上匹敵領先西方模型,卻未取得其更深層的漏洞利用能力。

AISI 的結果支持這一解讀。這些機構停用了美國模型的系統層級防護,以揭示幾乎不可能透過公開介面存取的網路能力——因此這些能力也大多無法用於蒸餾。