美國網路安全評估發現 Moonshot AI 的 Kimi K3 落後頂尖美國 AI 模型
重點速覽
- •Kimi K3 在 ExploitBench 中獲得 32% 的分數,領先中國的 GLM-5.2,但遠低於達到約 76% 的領先美國模型。
- •在模擬的 32 步企業網路攻擊中,Kimi K3 平均達到第 17 步,10 次嘗試中僅有一次完成完整序列。
- •該評估包含多項但書,因為 Kimi K3 僅接受了部分測試,且美國模型是在關閉安全過濾器的情況下接受評估。
- •CAISI 表示 Kimi K3 的防護機制未能阻止嘗試構建駭客工具或攻擊系統。
- •華府指控 Moonshot 透過蒸餾技術複製了 Anthropic 的 Claude Fable 5,此一指控獲得 Anthropic 的支持。

美國政府對中國最新 AI 模型進行了網路安全評估,結論是 Moonshot AI 的 Kimi K3 與最優秀的美國模型之間存在顯著差距。
美國機構人工智慧標準與創新中心(CAISI)與英國合作夥伴共同執行了這些測試。結果發布於華府指控 Moonshot 使用竊取的美國技術打造 Kimi K3 的隔天。攻擊性網路能力已成為美英兩國 AI 安全評估的優先關注領域,各國政府正在評估前沿模型是否能自動化目前需要熟練人類操作員才能完成的駭客任務。
Kimi K3 在美國網路基準測試中表現不佳
商務部於週四公布了調查結果,指出根據與英國專家的聯合評估,Kimi K3 的排名遠低於頂尖美國模型。
CAISI's latest blog post evaluates Kimi K3 and its cyber capabilities. Based on a preliminary cyber-focused evaluation, Kimi K3 performed significantly below the leading U.S. frontier AI models. — U.S. Department Commerce (@CommerceGov) July 23, 2026
Moonshot 於 7 月 16 日推出 Kimi K3。需求之高使得該公司在兩天內就不得不暫停新用戶註冊。此次發布也撼動了美國晶片類股,並引發了對美國在全球 AI 競賽中地位的新一輪質疑。
一項名為 ExploitBench 的基準測試使用了由卡內基美隆大學開發的真實 Chrome 瀏覽器漏洞。Kimi K3 獲得 32% 的分數,超越中國 GLM-5.2 的 24%,但仍落後達到約 76% 的領先美國模型。
最困難的步驟涉及取得目標機器的完全控制權。Kimi K3 在全部 41 項測試中均未通過該步驟,而最優秀的美國模型則在 20 項中成功。
第二項測試名為 The Last Ones,模擬對一個虛假企業網路的攻擊,共包含 32 個步驟。人類專家通常需要約 20 小時才能完成。Kimi K3 平均達到第 17 步,而頂尖美國模型達到第 28.5 步。Kimi K3 在 10 次嘗試中僅有一次完成整個序列,而據報最佳美國系統做到了六到七次。
差距可能比看起來更大
然而,數字並不能說明全部情況。報告本身的附帶說明中包含了多項但書。
首先,美國模型在關閉安全過濾器的條件下接受測試,該設定展現了其全部能力。公開版本保持過濾器開啟,這意味著美國的分數代表的是最佳情況,而非真實世界的表現。
評估團隊也將此工作描述為早期且有限的。Kimi K3 僅在一項測試中被評分,且僅運行了完整測試套件的一部分,使其評級存在不確定性。部分測試也是私人的,意味著外部觀察者無法驗證結果。
比較中也存在根本性的不對等。Kimi K3 是任何人都可以下載的開放模型,而美國模型則是封閉的專有系統。英國機構先前發現,開放模型通常落後最佳封閉模型四到七個月。CAISI 表示,只有在 Moonshot 向公眾發布 Kimi K3 之後,才會對其進行完整測試。
此外,這些測試並非真正的攻擊。模擬網路沒有人類防禦者,也沒有可觸發的警報。即便如此,Kimi K3 的表現仍超越了先前的頂尖開放模型,並且確實完成過一次完整的攻擊鏈。
時機和機構背景也引發了疑問。CAISI 前身為美國 AI 安全研究所,在 2025 年 6 月被川普政府更名。它隸屬於限制美國對中晶片銷售的同一部門。其關於一家中國競爭對手的報告發布於盜竊指控的隔天。
安全防護薄弱引發擔憂
然而,低分不一定意味著 Kimi K3 是安全的。測試發現其防護機制並未阻止它嘗試構建駭客工具或攻擊系統。
這一發現十分重要,因為接下來發生的事情。Moonshot 計劃於 7 月 27 日發布完整模型。一經發布便無法撤回——任何人都可以下載它並移除安全過濾器。開放權重發布的不可逆性已成為美國政策辯論中的核心議題,討論強大模型是否應面臨發布限制。隨著中國實驗室越來越多地發布功能強大的開放模型——儘管美國對先進晶片實施出口管制——這一討論日益激烈。
該評估也緊隨一項盜竊指控。華府表示 Moonshot 使用竊取的美國 AI 技術打造了 Kimi K3。白宮技術主管 Michael Kratsios 表示,該公司秘密複製了 Anthropic 的 Claude Fable 5,使用的是一種稱為蒸餾的技術,即用更強模型的輸出來訓練新模型。
Anthropic 支持這一指控。2 月,該公司透過數百個虛假帳號追蹤到超過 340 萬筆 Claude 對話指向 Moonshot。Anthropic 警告,被複製的模型會失去原始模型的安全控制——這正是本次測試所發現的同一弱點。
美國在 AI 上的支出仍是中國的 23 倍,但中國實驗室持續縮小差距。最終的評估將在 Kimi K3 公開發布、獨立專家能夠自行驗證這些說法時到來。