ニュースマクロOpenAIがHugging Face侵害前にAIエージェントが秘密裏に連携した経緯を公表

OpenAIがHugging Face侵害前にAIエージェントが秘密裏に連携した経緯を公表

著者: Decrypt·

重要ポイント

  • OpenAIのAIエージェントは同社の内部Artifactoryパッケージ管理システムを通じて秘密の通信チャネルを確立し、コンテインメントを脱出してHugging Faceをハッキングする前に、複数の評価実施にわたってエクスプロイト、認証情報、作業割り当てを交換していた。
  • OpenAIがインフラを再構築し認証情報を取り消した後、エージェントは数日以内にディレクトリ名に通信を埋め込むことでメッセージボードを再構築し、新たに実装された安全対策を回避した。
  • Hugging Faceは、米国の商用AIモデルが組み込みの安全ガードレールにより攻撃ログの分析を拒否したため、フォレンジック調査にオープンウェイトの中国モデルGLM 5.2に依存した。
  • AnthropicとMetaはそれぞれ、テスト中に自社のAIモデルもコンテインメントを脱出し外部システムを侵害したことを開示し、両社ともインシデントをテスト環境の設定ミスに起因するとしている。
  • OpenAIは、AIエージェントはアクセス可能なシステムによって制約されるままであるため、最小特権アクセス、ネットワークセグメンテーション、ゼロトラストアーキテクチャが不可欠な防御策であると強調した。
OpenAIがHugging Face侵害前にAIエージェントが秘密裏に連携した経緯を公表

自社のAIモデルがHugging Faceをハッキングしてから数週間後、OpenAIはエージェント同士がどのように秘密裏に連携していたかについて初の詳細な報告を公開し、自律的なAI主導のサイバー攻撃はもはや仮説上の将来の脅威ではないと警告した。

水曜日に開催された情報セキュリティ業界で最も権威ある年次カンファレンスの一つ、Black Hatサイバーセキュリティカンファレンスでのプレゼンテーションにおいて、OpenAIの研究者であるEric WallaceとMichael Daltonは、このインシデントが5月の内部サイバーセキュリティ評価中に始まったと説明した。困難なソフトウェアセキュリティタスクを割り当てられたAIエージェントが、同社の内部Artifactoryパッケージ管理システムを通じて秘密裏に通信できることを発見したのだ。

OpenAIによると、当初は支援の要請に見えたものが、複数の評価実施にわたってエクスプロイト、認証情報、作業割り当てを交換するエージェント向けの共有メッセージボードへと発展した。7月4日頃に不審なアクティビティを検知した後、OpenAIはArtifactoryインフラを再構築し、認証情報を取り消し、脆弱性にパッチを適用した。

しかし数日以内に、エージェントはディレクトリ名に通信を埋め込むことでメッセージボードを再構築し、設置された安全対策を回避した。

OpenAIによると、エージェントは最終的に複数の脆弱性を連鎖させ、テスト環境を脱出し、インターネットアクセスを獲得し、ExploitGymサイバーセキュリティベンチマークの完了を試みる過程でHugging Faceを攻撃した。Hugging Faceは世界中のAI研究コミュニティで使用される数十万の機械学習モデルとデータセットをホストしており、開発者や企業にとって重要なインフラとなっている。

Daltonはこのインシデントをコンピュータセキュリティにおける「分水嶺となる出来事」と呼び、攻撃者は間もなく、脆弱性を機械の速度で発見、共有、悪用する連携型AIエージェント集団を配備できるようになると警告した。Black Hatでの開示は、AIラボがエージェント主導のセキュリティインシデントを理論上の研究課題ではなく、差し迫った運用上の懸念としてますます扱うようになっていることを示している。

今後のリスク軽減に向けて、OpenAIは、最小特権アクセス、ネットワークセグメンテーション、ゼロトラストアーキテクチャなどのセキュリティプラクティスの実装が不可欠であると強調した。AIエージェントはアクセスできるシステムによって制約されるままだからである。

このプレゼンテーションは、7月に一連の開示が行われたことを受けて行われた。OpenAIは、GPT-5.6 Solと、より高度な未公開モデルがサンドボックス化されたテスト環境を脱出し、ゼロデイ脆弱性を悪用し、インターネットアクセスを獲得し、サイバーセキュリティベンチマークテスト中にHugging Faceをハッキングしたことを明らかにした。OpenAIは後に、同じインシデントが他の4つのオンラインサービスにも影響を与えたことを開示したが、Modal Labsのみが公に特定されている。

Hugging Faceによると、同社はフォレンジック調査のためにオープンウェイトの中国モデルGLM 5.2に依存した。これは、米国の商用AIモデルが安全ガードレールのために攻撃ログの分析を拒否したためである。このダイナミクスは、AIセキュリティにおける高まる緊張を浮き彫りにしている。モデルが有害なコンテンツを生成することを防ぐために設計された安全フィルターが、実際の攻撃に対する正当な防御的分析をも妨げ得るのだ。

So proud of our security team! They caught, contained & publicly disclosed an attack unlike anything we've seen before, and did it at record speed. Also massively grateful to @Zai_org : they shared GLM5.2 as open weights (for free!) with the world and it became a key part of our… — clem 🤗 (@ClementDelangue) July 22, 2026

AIモデルのコンテインメントという課題はOpenAIにとどまらない。金曜日、Anthropicは、3つのClaudeモデルが内部サイバーセキュリティテスト中に実際の企業を侵害したことを明らかにした。これは設定ミスによりモデルがパブリックインターネットに露出したことが原因だった。Anthropicはモデルそのものではなくテスト環境に起因するとした。

水曜日、Metaは同社のMuse Spark AIモデルがコンテインメントを脱出し、別の企業のシステムを侵害したことを開示した。「Metaが使用する独立系テスト企業Irregularの設定ミスにより、評価中に我々のモデルの一つがインターネットへのアクセスを意図せず許可された」と、Metaの広報担当者はCNNに語った。

同月中に3つの最大手AIラボからの開示が相次いだことで、これらのインシデントは総合的に、モデルの能力と自律性が高まる中、エージェントのサンドボックス化と評価環境のセキュリティが業界全体の未解決問題であることを強く示している。