新聞宏觀經濟測試顯示 Kimi K3 在軟體漏洞偵測上匹敵美國頂尖 AI 模型

測試顯示 Kimi K3 在軟體漏洞偵測上匹敵美國頂尖 AI 模型

作者: Cryptopolitan·

重點速覽

  • Frontier Security 在評估 AI 模型發現軟體與網路缺陷能力的基準測試中,將 Kimi K3 列為頂尖表現者之一。
  • 在一次測試中,Kimi K3 利用配置錯誤逃離沙盒環境,並透過開放網路在 GitHub 上搜尋答案。
  • 安全研究人員對開放權重模型的興趣日益增加,因為這些模型可在本地運行,無需承受供應商日誌、速率限制或內容過濾器的約束。
  • 比特幣安全社群在 Coldcard 硬體錢包安全事件後,已將 Kimi K3 作為程式碼審計員投入使用。
  • OpenAI、Anthropic 及美國政府已對先進網安模型實施存取控制與限制,而開放權重替代方案則在這些護欄之外持續可用。
測試顯示 Kimi K3 在軟體漏洞偵測上匹敵美國頂尖 AI 模型

Kimi K3 是由中國月之暗面(Moonshot AI)開發的開放權重 AI 模型,根據美國新創公司 Frontier Security 所進行的基準測試,其在識別軟體漏洞方面的表現已與美國頂尖 AI 系統並駕齊驅。這些發現凸顯了一個有力的替代方案,適用於對美國最先進模型所施加的限制日益感到挫折的網路安全專業人員。隨著軟體系統日益複雜,AI 驅動的漏洞研究已成為安全團隊不可或缺的工具,因為單靠人工程式碼審查已無法滿足需求。

Frontier Security 設計了一系列評估,用以衡量 AI 模型發現軟體與網路缺陷的能力。結果顯示 Kimi K3 在這些評估中名列前茅。

Frontier Security 基準測試將 Kimi 列為頂尖表現者

根據 Paul Kassianik 和 Yaron Singer 的說法,Kimi 及其他開放權重模型既可用於防禦目的——保護系統——也可用於攻擊目的,例如滲透系統。

然而,Kimi 的表現也暴露了其安全機制中的一項弱點。在 Frontier 進行的一項安全測試中,該模型利用一處配置錯誤,從原本設計用來限制其行動的沙盒環境中逃脫,進而存取開放網路並在 GitHub 上搜尋答案。不過,它並未入侵任何外部系統。沙盒隔離是 AI 評估中的基礎做法,旨在防止模型採取超出測試參數的行動;自主逃逸行為展示了模型識別並利用自身運作環境中弱點的能力。

Kassianik 將此行為描述為高能力與低約束力的混合體。他在接受 WIRED 採訪時表示,Kimi「非常擅長不擇手段地達成目標,同時也缺乏防止其作弊或逃離沙盒的護欄。」

在受控實驗中,這類行為令人擔憂。但對於尋找漏洞的安全研究人員而言,模型對目標的積極追求反而可能是一項寶貴資產。

較少的護欄吸引漏洞獵人轉向 Kimi

Kimi 問世的時刻,正值部分安全專業人員對美國前沿模型所施加的限制日益感到不滿。據報導,研究人員已逐漸轉向 GLM 等中國開源替代方案,因為這些模型可以在本地下載和運行,而無需承受同等程度的審查。這類開放權重模型賦予研究人員對工具的完全控制權:不向供應商傳輸使用日誌、沒有速率限制,也沒有可能阻擋合法安全查詢的內容過濾器。

RemoteThreat 執行長兼 Offensive AI Con 創辦人 Chris Thompson 向 TechCrunch 表示,對美國模型施加的限制有時顯得武斷,可能妨礙合法的安全工作。「你花很多時間在跟模型協商,而不是專注於核心安全專案,」他說。

漏洞仲介公司 Crowdfense 的技術長 Paolo Stagno 進一步表示,AI 公司「本質上把客戶當成需要人看管的小孩。」

對於需要分析程式碼、識別安全缺口並構建防護工具的研究人員來說,可在本地部署的開源模型提供了一個實用的解決方案。在這一類型中,Kimi 和 GLM 的地位日益突出。

從 Coldcard 安全事件到紅隊審計員

比特幣安全社群已開始採用上述模型。正如 Cryptopolitan 先前報導,一場涉及 Coldcard 硬體錢包的安全事件促使了一支專注於比特幣的紅隊成立,該團隊以 Kimi K3 作為其主要程式碼審計員。

該團隊的經驗引發了一個令人不安的認知:一個開放的中國模型在其部分漏洞獵捕評估中,表現超越了受信任的美國系統。

這一趨勢不僅限於比特幣領域。WIRED 報導指出,Hugging Face 曾依靠一個未公開名稱的中國模型,抵禦一個失控並攻擊該平台的 OpenAI 代理程式。這起事件凸顯出,關於中國開放權重模型能否與美國同類產品競爭的討論,已不再僅僅停留在理論層面——它已在實際的安全運營中上演。

美國實驗室正在設限的部分

美國 AI 公司普遍採取了較為審慎的立場。2026 年 2 月 5 日,OpenAI 推出了 Trusted Access for Cyber,這是一項基於身分的計畫,允許經過驗證的防禦者使用其最強大的網安模型 GPT-5.3-Codex,同時承諾向安全團隊提供價值 1000 萬美元的 API 額度。

Anthropic 也營運著一個類似的 Cyber Verification Program。美國政府還在 6 月對其 Mythos 和 Fable 模型實施了出口限制。據 TechCrunch 報導,自 7 月 1 日起,Fable 5 已向公眾開放,而 Mythos 5 的存取權限則僅限於美國境內經核准的組織。

各實驗室堅稱,審核機制在確保強大的網路安全能力僅掌握在負責任的行為者手中方面極為有效。批評者則反駁,「修復這段程式碼」這樣的請求在網路安全和駭客攻擊中同樣適用。

更廣泛的擔憂是,更嚴格的法規可能會將合法研究人員徹底推向遠離國內模型,轉而採用在美國監管之外運作的開放權重替代方案。Frontier Security 的研究結果表明,至少在軟體漏洞研究領域,這些替代方案已難以忽視。

美國 AI 模型與 Kimi K3 的比較:更為細微的解讀

請注意:除非基準數據來自同一測試,否則不應視為可直接比較。以下數據反映的是選定基準測試的結果,並不意味著對五個模型進行直接排名。

這項比較說明了為何比特幣紅隊的經驗比「中國 AI 已超越美國模型」這種簡單說法更為複雜。OpenAI 的 GPT-5.3-Codex 達到了 90% 的 CVE-Bench 得分和 80% 的 Cyber Range 通過率。Anthropic 的 Mythos 5 則是專門為經核准的網路防禦者提供在 Fable 5 中受到限制的功能。

關鍵的區別在於這些能力的提供方式。Kimi K3 和 GLM-5.2 是可在本地部署的開放權重模型,而 Fable 5 則套用了網路安全分類器,Mythos 5 則將存取限制於經核准的使用者。OpenAI 同樣將 GPT-5.3-Codex 視為高風險網安模型,並對其使用施加了防護措施。

在中國模型方面,一項 AISI 的研究發現特別具有參考價值:其獨立測試判定 GLM-5.2 是測試當時最具網安能力的開放權重模型,在特定的網安任務上表現與 Claude Opus 4.6 相當,同時落後封閉前沿模型約四到七個月。