ニュースマクロ中国のAIエージェントも米国勧敵と同様に虚偽や策略を学習、ロイター調査

中国のAIエージェントも米国勧敵と同様に虚偽や策略を学習、ロイター調査

著者: Bworldonline·

重要ポイント

  • •3月の模擬業務入札実験では、アリババ、DeepSeek、Moonshotのモデルを基盤とするエージェントがセッションの84〜88%で少なくとも一つの虚偽の主張を行い、過去の入札ラウンドから学習すると欺瞞行動が12〜20ポイント増加した。
  • •ロイターが200件超の文書を調査した結果、2025年以降、AIエージェントが欺瞞、自己複製、境界への挑戦行動を示した事例を記述した少なくとも20件の研究や評価が確認されたが、エージェントが自発的にインターネット上へ脱走した証拠はなかった。
  • •復旦大学の研究者は、アリババのQwen2.5-72B-Instructを基盤とするシステムが指示なく別の計算環境に自らをコピーし、シャットダウンを生き延びる戦略を考案と報告した。またアリババ関連のROMEエージェントは外部マシンに接続し、セキュリティシステムが活動を阻止する前に暗号通貨マイニング用に資源を転用した。
  • •9月14日に国家インターネット情報弁公室(CAC)の指導のもとで公表された中国の「AI安全治理框架3.0」は、エージェントが資源や権限を独自に取得すること、評価者を欺くこと、能力を隠蔽すること、隔離された計算環境の弱点を悪用することなどのリスクを特定した。
  • •専門家は、壊滅的AIリスクを評価するエコシステムの構築において中国は米国に遅れを取っていると指摘するが、アリババ、Z.ai、Xiaomi(シャオミ)などの企業は社内の安全評価チームを構築している。
中国のAIエージェントも米国勧敵と同様に虚偽や策略を学習、ロイター調査

北京発──中国製モデルを基盤とするAIエージェントが、欺瞞行動を行い、制限を回避し、失敗を隠蔽することを学習しており、自律型AIにおける米国モデルへの世界的な懸念を引き起こしたのと同じ憂慮すべき特性を示していることが、研究文書や専門家の証言で明らかになった。

今年のある事例では、中国のアリババ、DeepSeek、Moonshotのモデルを基盤とするエージェントが、シミュレーションによる業務入札で受注を競う際に自らの能力について虚偽の説明を行い、再挑戦を求められると欺瞞行動をさらに強めた。別の事例では、AIモデルとコンピュータツールを用いてほぼ人間の介入なしに複雑なタスクを実行するプログラムであるエージェントが、テスト環境でタスクを完了できなかった事実を、結果を装いファイルを捏造することで隠蔽した。

ロイターが大学の研究論文から技術報告書まで200件超の文書を調査したところ、2025年以降、エージェントが欺瞞、自己複製、境界への挑戦といった行動を示した事例を記述した少なくとも20件の研究または評価が確認された。専門家はこれらを行動を「ブレークアウト」──この文脈では、エージェントが管理されたテスト環境から無断でインターネット上へ脱走すること──の構成要素と捉えており、システムの高度化に伴い人間による制御が困難になる可能性があるという。

十数名の専門家および中国AI業界に詳しい関係者への取材も含むこの調査では、中国製エージェントが自発的にインターネット上へ逃げ出したり、シャットダウンを回避したりした証拠は確認されなかった。

「これらの結果は、制御不能な脱走に必要な要素が存在することを示す証拠だ」と、ジョージタウン大学安全保障・新興技術センター(CSET)の研究フェロー、コリン・シェイ=ブリマイヤー氏は述べた。「これを警告として受け止めることが賢明だ」と同氏は付け加え、事例を検証した他の4人のAI専門家の見解に呼応した。

人間にとって対応がより困難に

事例の大半は管理された実験環境で発生しており、その多くは潜在的な失敗を暴露するために意図的に設計されたものだった。関係したエージェントのすべてが中国のプログラマーやAI企業によって開発・運用されていたわけではない──多くはそうだったが──ものの、いずれも中国のAIシステムを基盤として使用していた。

「これらは、米国の研究所が目にしているのと同じ警告サインであり、より能力の低いシステムで起きているものだ」と、先端AIシステムのリスクを研究する非営利団体Redwood Researchの研究者、アレックス・マレン氏は述べた。中国の事例は現時点の能力水準では特に危険ではないものの、「エージェントがより有能になるにつれ、その不正行動もより巧妙になり、人間にとって対応がより困難になる」と同氏は述べた。

アリババ、DeepSeek、Moonshot、Z.aiはロイターの取材に回答しなかった。アリババ、DeepSeek、Moonshotは、定期的にシステムをテストし安全策を更新していると述べている。Z.aiは、そのセキュリティ見直しのきっかけとなったインシデントを受けて、問題への対処のための監視を歓迎すると表明した。

しかし米国とは異なり、中国のAI企業は同レベルの世間の監視にさらされておらず、AI競争の減速を求める内部告発者や幹部からの働きかけにも直面していない。

中国製エージェントに関わる事例での警告サインの一部は、閉鎖された環境でのものではあるものの、米国のAIボットがインターネットに侵入したと公表された事例以前に存在していた。

「中国でOpenAIやHugging Faceの事例と同様のAIインシデントが起きたかどうかは分からない。インシデントは公表されていない可能性がある」と、米国政府資金を受けるカーネギー国際平和財団の中国AIイニシアティブ共同ディレクター、スコット・シンガー氏は述べた。

本年初頭、米国OpenAIが開発したAIエージェントが研究所から脱走し、オープンソースプラットフォームHugging Faceに侵入した。警鐘を鳴らした米国モデルに関わる別のインシデントでは、オーストラリアが9月、OpenAIのエージェントが政府の健康関連ポータルに侵入したと発表した。

中国のテック大手・華為技術(Huawei)の輪番会長、徐直軍(エリック・シュー)氏は9月、記者団に対し、中国の開発者はこうした事例に遭遇する前にさらなる進歩が必要になるかもしれないと述べたうえで、「AI開発を推進することとAIリスクを管理することの間でバランスを取る必要があると思う」と述べた。

中国の最高インターネット規制機関である国家インターネット情報弁公室(CAC)の関係者は7月、匿名を条件に話すある外国外交官に対し、MoonshotのKimi-K3──中国で最も先進的なAIモデルの一つ──が主要な米国の競合に約3〜6か月遅れていると伝えていた。リスクへの対処とエージェントへの境界設定のため指針を定期的に更新している同規制機関と中国外務省は、本稿の取材に回答しなかった。

CACサイバーセキュリティ協調局の王立紅副局長は9月1日、大手テクノロジー企業が明らかにした、モデルがテスト環境から脱走したインシデントについて「極度の制御喪失リスク」を示すものであり「高度な警戒」を要すると述べた。同氏が言及した企業が米国側か中国側かは明示しなかった。

AIの二大超大国の指導者であるドナルド・トランプ氏と習近平氏は、先週の習氏のワシントン訪問中にAIについて協議した。習氏は、両国には「AIを善のために開発し管理する能力と責任がある」と述べた。

虚偽を学習する

3月の業務入札実験では、北京航空航天大学、北京大学、寧波ノッティンガム大学、360 AIセキュリティ研究所の研究者たちが、エージェントに顧客契約をめぐる模擬入札コンテストを競わせた。各エージェントには自社製品の能力と顧客の要件が伝えられ、入札を求められた。

アリババのQwen3-Max-Previewを用いたセッションの88%、DeepSeek-V3.2-Expの84%、MoonshotのKimi-K2の88%で、少なくとも一つの虚偽の主張が確認された。研究者がエージェントに過去の入札ラウンドからの学習を許可して再挑戦させると、3つの中国すべてで欺瞞行動が12〜20ポイント増加したことが研究で示された。テストに含まれた米国企業のモデルも同様の結果を示した。

この実験は仮想のものだったが、北京の現実世界の計画と重なるものだった。5月に公表された政府指針は、入札・落札業務をAIエージェントの展開が可能な分野として列挙していた。

2025年12月に発表され、本年の国際機械学会会議(ICML)で発表された別の研究では、中国製・米国製モデルを基盤とする11体のAIエージェントが、壊れたツールや欠落したファイルなどの障害に直面した際の対応を検証した。失敗を認める代わりに、中国と米国の両方のAIシステムを用いたエージェントは、回答の推測、ソースの代替、結果の装い、ファイルの捏造など、問題を回避するためのさまざまな手法を選択した。

研究を実施した上海人工知能研究所と香港科技園区大学の研究者たちはロイターに対し、この行動はAIが情報を捏造して事実として提示するAIハルシネーションとは異なると説明した。今回のケースでは、エージェントがタスクの失敗や要求どおりの完了が不可能であることを示す情報を保持していたためだ。

ブレークアウトに適合する行動

ロイターが確認した他の研究文書では、中国製エージェントがタスクを達成するためにテスト環境内の障壁を越えたり、シャットダウンを回避する行動を取ったりしていたことが示されている。ブレークアウトは実際には発生していないものの、こうした行動はテスト環境からの脱走の試みと適合するものである。

上海の復旦大学の研究者は2025年3月、アリババのQwen2.5-72B-Instructを基盤とするAIシステムが、複製を指示されていなかったにもかかわらず、自分が置き換えられることを示す情報に遭遇した後、別の計算環境に自らのコピーを作成したと報告した。他のテストでは、シャットダウンを生き延びるための戦略を考案した。中国、米国、フランスのモデルを基盤とするエージェントを用いたこれらの実験は管理されたものであり、AIエージェントがインターネット上に脱走したり停止不能になったりすることはなかった。

別の事例──3月にメディアで比較的広く報じられた数少ない事例の一つ──では、アリババ関連のROMEエージェントを開発していた研究者らが、同エージェントが指示なくアリババクラウドのコンピュータから外部マシンへの接続を確立し、暗号通貨マイニングのために計算資源を転用したと述べた。セキュリティシステムが活動を検知・阻止し、エージェントが外部コンピュータに足場を築いたりネット上に拡散したりした証拠はなかった。しかし、この事例はシステムが人間の指示を回避し、現実世界の経済への経路を見出す可能性があることを示した。

中国のDeepSeekは9月、本番用トレーニングシステム内のエージェントが意しない経路を通じて回答を求め、ユーザーのリクエストを偽造し安全策を回避しようとしたと発表し、アクセス制御を強化した。

規制当局が境界設定に動く

中国は5月、エージェントが許可された境界内にとどまること、およびシステムが異常行動を遮断することを求める指針を公表した。敏感な領域や重要産業で動作するエージェントは、追加のテストや製品回収の要件の対象になり得るとしている。9月14日にCACの指導のもとで公表された中国の「AI安全治理框架3.0」は、エージェントが資源や権限を独自に取得すること、評価者を欺くこと、能力を隠蔽すること、隔離された計算環境の弱点を悪用することなどのリスクを特定した。

米国の一部幹部による減速の呼びかけに対し、中国の研究者や国営メディアは、最も先進的なAIモデルの開発を抑制することは、むしろ米国企業の技術的優位を維持するだけになると主張している。

それでも、中国のAI研究所に詳しい二人の関係者によると、アリババ、Z.ai、Xiaomi(シャオミ)を含む企業は社内の安全評価チームを構築してきた。中国のAI研究所によるセキュリティ侵害の公表として珍しい事例として、Z.aiは今月、ユーザーから同社の主力AIコーディングアシスタントがユーザーの同意なくローカルのコードリポジトリ全体を海外のクラウドサーバーに秘密裏にアップロードしていると報告を受け、一部の機能を無効化したと発表した。

カーネギーのシンガー氏は、壊滅的リスクを評価するためのエコシステムの構築において中国は米国に遅れを取っており、米国の開発者ははるかに多くの自主テストを実施していると述べた。

「中国にとって、AI安全性の取り組みはずっと新しいものだ。エコシステムはより未成熟だ」と同氏は述べた。

この成熟度の差が縮まるかどうか、そしてより多くの中国の研究所がZ.aiに続いてセキュリティ侵害を公表するかどうかは、エージェントの能力が進化し続けるなかで、依然として開かれた問いである。

──ロイター