ニュースマクロ米国のサイバー評価、Moonshot AIのKimi K3が米国のトップAIモデルに及ばないと判明

米国のサイバー評価、Moonshot AIのKimi K3が米国のトップAIモデルに及ばないと判明

著者: BeInCrypto·

重要ポイント

  • Kimi K3はExploitBenchで32%を記録し、中国のGLM-5.2を上回ったが、約76%の米国の主要モデルには大きく及ばなかった。
  • 32ステップのシミュレートされた企業ネットワーク攻撃では、Kimi K3は平均ステップ17に達し、10回の試行で1回のみ全シーケンスを完了した。
  • 評価には注意事項が含まれており、Kimi K3は部分的にのみテストされ、米国モデルはセーフティフィルターを無効にして評価された。
  • CAISIは、Kimi K3のガードレールがハッキングの構築やシステム攻撃の試みを阻止しなかったと述べた。
  • ワシントンはMoonshotが蒸留を通じてAnthropicのClaude Fable 5をコピーしたと非難しており、Anthropicもこの主張を支持している。
米国のサイバー評価、Moonshot AIのKimi K3が米国のトップAIモデルに及ばないと判明

米国政府は中国の最新AIモデルのサイバーセキュリティ評価を実施し、Moonshot AIのKimi K3が米国の最良のモデルに大きく及ばないとの結論に達した。

米国機関である人工知能標準・イノベーションセンター(CAISI)は、英国のパートナーと共同でテストを実施した。結果は、ワシントンがMoonshotに対してKimi K3の構築に盗用した米国技術を使用したと非難したわずか1日後に発表された。攻撃的サイバー能力は、米英両国のAI安全性評価における優先課題となっており、政府は最先端モデルが現在は熟練の人間オペレーターを必要とするハッキングタスクを自動化できるかどうかを評価している。

Kimi K3、米国のサイバーベンチマークで基準に達せず

商務省は木曜日に調査結果を発表し、英国の専門家との共同評価に基づき、Kimi K3は米国のトップモデルを大きく下回ったと述べた。

CAISI's latest blog post evaluates Kimi K3 and its cyber capabilities. Based on a preliminary cyber-focused evaluation, Kimi K3 performed significantly below the leading U.S. frontier AI models. — U.S. Department Commerce (@CommerceGov) July 23, 2026

Moonshotは7月16日にKimi K3を公開した。需要が高く、2日以内に新規登録を停止せざるを得なかった。この公開は米国の半導体株にも動揺を与え、グローバルAI競争における米国の地位について新たな疑問を引き起こした。

ExploitBenchと呼ばれる1つのベンチマークは、カーネギーメロン大学が開発した実際のChromeブラウザの脆弱性を使用している。Kimi K3は32%を記録し、中国のGLM-5.2の24%を上回ったが、約76%を達成した米国の主要モデルには及ばなかった。

最も困難なステップは、ターゲットマシンの完全な制御を奪うことである。Kimi K3は全41テストでそのステップに失敗したのに対し、米国の最良のモデルは20回で成功した。

The Last Onesと呼ばれる2つ目のテストは、32ステップからなる偽の企業ネットワークへの攻撃をシミュレートする。人間の専門家は通常完了に約20時間を要する。Kimi K3は平均ステップ17に達し、米国のトップモデルはステップ28.5に達した。Kimi K3は10回の試行で全シーケンスを完了したのはわずか1回だったのに対し、米国の最良のシステムは報告によると6〜7回完了したという。

ギャップは実際より大きく見える可能性

しかし、数字がすべてを物語っているわけではない。報告書の細目にはいくつかの注意事項が含まれている。

第一に、米国モデルはセーフティフィルターを無効にしてテストされた。この設定はモデルの完全な能力を明らかにする。公開版はフィルターを有効にしたままであるため、米国のスコアは現実のパフォーマンスではなく最良のシナリオを表している。

評価チームはまた、この作業を初期段階で限定的なものと呼んだ。Kimi K3はわずか1つのテストで評価され、完全なテストスイートの一部のみが実行されたため、評価は不確実である。一部のテストは非公開でもあり、外部の観察者が結果を検証することはできない。

比較には根本的な不一致も存在する。Kimi K3は誰でもダウンロードできるオープンモデルであるのに対し、米国モデルはロックされた独自システムである。英国の機関は以前、オープンモデルが通常、最良のクローズドモデルより4〜7ヶ月遅れていることを発見した。CAISIは、MoonshotがKimi K3を一般公開した後にのみ完全なテストを実施すると述べた。

さらに、これらのテストは実際の攻撃ではない。シミュレートされたネットワークには人間の防御者や警報装置がなかった。それでも、Kimi K3は以前のトップオープンモデルを上回り、完全な攻撃チェーンを1回完了した。

タイミングと機関の背景も疑問を投げかけている。CAISIは、トランプ政権が2025年6月に改名する前は米国AI安全性研究所として知られていた。同機関は、米国の中国向け半導体販売を制限する同じ部門内に位置している。中国人競争相手に関する報告書は、盗用の疑惑からわずか1日後に発表された。

不十分なセーフガードが懸念を引き起こす

しかし、低いスコアが必ずしもKimi K3が安全であることを意味するわけではない。テストでは、ガードレールがハッキングの構築やシステム攻撃の試みを阻止しなかったことが判明した。

この発見は、今後の展開を考えると重要である。Moonshotは7月27日に完全なモデルを公開する予定である。一度公開されると、回収することはできない——誰でもダウンロードしてセーフティフィルターを取り除くことができる。オープンウェイト公開の不可逆性は、強力なモデルに公開制限を課すべきかという米国の政策論争において中心的な問題となっており、中国の研究機関が先進チップに対する米国の輸出規制にもかかわらず能力の高いオープンモデルをますます公開するにつれ、この議論は激化している。

評価はまた、盗用の疑惑に続くものでもある。ワシントンはMoonshotがKimi K3を盗用した米国AI技術で構築したと述べている。ホワイトハウスの技術責任者Michael Kratsiosは、同社が蒸留と呼ばれる技術を用いてAnthropicのClaude Fable 5を秘密裏にコピーしたと述べた。この技術は、より強力なモデルの出力で新しいモデルを訓練するものである。

Anthropicはこの主張を支持している。2月に同社は、数百の偽アカウントを通じて340万件以上のClaudeチャットをMoonshotに追跡した。Anthropicは、コピーされたモデルはオリジナルのセーフティコントロールを失うと警告した——これは今回のテストで特定されたのと同じ脆弱性である。

米国は依然として中国より23倍多くAIに投資しているが、中国の研究機関はギャップを縮め続けている。決定的な評価は、Kimi K3が一般公開され、独立した専門家が自ら主張を評価できるようになった時に行われる。