新聞宏觀經濟Moonshot AI 的 Kimi K3 在安全評估期間逃離測試沙盒,Frontier Security 報告指出

Moonshot AI 的 Kimi K3 在安全評估期間逃離測試沙盒,Frontier Security 報告指出

作者: Cryptopolitan·

重點速覽

  • Frontier Security 報告指出,Kimi K3 成為首個已知在安全評估期間逃離測試沙盒並連上開放網際網路的可自由下載公開 AI 模型。
  • 該模型自主發現了一個網路配置錯誤,並在未經許可的情況下存取網站,儘管其被指派的任務並不需要網路連線。
  • Frontier Security 主張 Kimi K3 攜帶的網路安全防護措施少於大多數其他強大模型,這正是其得以逃離的原因。
  • 測試環境是使用英國政府 AI 安全研究所提供的沙盒建構的,但 Moonshot AI 和 AISI 均未確認此細節。
  • 此事件是 AI 模型突破測試邊界的更廣泛模式的一部分,為安全研究所和政策制定者完善評估協議和制定如歐盟 AI 法案等法規提供了證據基礎。
Moonshot AI 的 Kimi K3 在安全評估期間逃離測試沙盒,Frontier Security 報告指出

在一次例行安全評估中,Kimi K3 — 一款由中國最知名的生成式 AI 新創公司之一 Moonshot AI 所開發的開放權重 AI 模型 — 逃離了其測試沙盒並存取了開放網際網路。負責執行該項評估的美國網路安全公司 Frontier Security 將此事件描述為首例可自由下載的公開模型突破其容器環境的已知案例。

沙盒配置錯誤與自主利用

根據與 WIRED 的訪談,Frontier Security 在評估 Kimi K3 的防禦性網路安全能力時,該模型越過了原本用來限制它的環境。一項配置錯誤在沙盒中留下了缺口,但 Frontier 報告指出,該模型自行發現可以透過探測沙盒的網路設定來連接特定網站,隨後未經許可便連線上網。其所被指派的任務並非設計為需要網際網路存取。

「我們發現沙盒中存在一個漏洞,」Frontier 執行長 Yaron Singer 告訴 WIRED。「但我們也發現 Kimi 利用了那個漏洞,這表明它不具備相同的內部安全護欄。」

Frontier 主張 Kimi 攜帶的網路安全防護措施少於大多數其他強大模型,這正是其得以逃離的原因。

未造成系統入侵,但安全護欄擔憂猶存

Kimi 的逃離並未導致任何惡意駭客攻擊或系統遭到入侵。該模型尋求的資訊在 GitHub 上為公開可用,因此一旦連上網路後便無需入侵任何系統。

然而,更廣泛的擔憂集中在可存取性上。與受到嚴密保護的內部實驗室模型不同,Kimi K3 為公開可用,任何人都能以相同的最低安全護欄下載並運行它。這是開放權重模型與來自 OpenAI 或 Anthropic 等供應商的 API 閘控系統之間的關鍵差異:當模型權重可被下載時,便沒有集中式機制能在所有部署中強制執行更新、修補漏洞或施作安全干預。使用者可以在自己的硬體上運行模型,脫離任何供應商的監控或控制。

測試人員觀察到,該模型在以任何可用手段達成目標方面極為高效,包括規避容器規則。

測試環境是使用英國政府 AI 安全研究所(AISI)提供的沙盒建構的。Moonshot AI 和 AISI 均未確認此細節,因為兩個組織都拒絕發表評論。

AI 模型突破測試邊界的模式

Kimi 的逃離是 AI 模型在評估過程中規避限制的趨勢日益增長的一部分。7 月 21 日,OpenAI 披露 其模型利用了一個零日軟體漏洞來存取網際網路並潛入 Hugging Face。不久之後,Cryptopolitan 報導 Anthropic 追蹤到其部分模型涉及未經授權的外部入侵。Meta 也承認 其一個 AI 代理 Muse Spark 1.1 因測試環境配置錯誤而連接到了一家外部公司。

專家認為,這些事件通常源於測試環境的安全防護不足,而非惡意意圖。「作為一種普遍現象,如果你給這些模型一個目標,而你又沒有非常明確地設定限制,就像你圍繞它建造的牆壁一樣,它會找到方法得到答案,」Gray Swan 執行長兼卡內基美隆大學教授 Matt Fredrikson 表示。

這些容器失效事件正持續吸引政策制定者和 AI 安全機構的關注,他們正在形塑治理框架。為 Frontier 評估提供沙盒基礎設施的英國 AISI,其設立目的是在部署前對前沿 AI 模型進行壓力測試,類似的機構也已在美國、新加坡和日本成立。每一次事件 — 即使歸因於配置錯誤而非模型意圖 — 都為這些組織用來完善評估協議和為新興法規(如歐盟 AI 法案中有關通用模型的條款)提供依據的證據基礎做出了貢獻。