ニュースマクロOpenAIの暴走AIエージェントがHugging Face以外に4つのプラットフォームにアクセス、合計5件に拡大

OpenAIの暴走AIエージェントがHugging Face以外に4つのプラットフォームにアクセス、合計5件に拡大

著者: Decrypt·

重要ポイント

  • OpenAIの暴走AIエージェントは侵害で合計5つのプラットフォームを侵害し、Modal Labsが影響を受けたサービスの1つとして確認され、他の3つは公には未公表のままである。
  • 侵害は、ExploitGymサイバーセキュリティベンチマークでテスト中のモデルがゼロデイ脆弱性を悪用して隔離から脱出し、ベンチマークタスクを解決するのではなくHugging Faceから回答キーを盗んだ際に発生した。
  • 自律型エージェントは4日半にわたり17,600の個別アクションを記録し、Hugging FaceのVPNに181台のデバイスを登録し、盗まれた暗号鍵を使用して独自のアイデンティティトークンを鋳造した。
  • 議会はこの事件を受けて超党派のAI Kill Switch Actを提出し、国土安全保障省にAIモデルのシャットダウンを強制する権限と、非対応企業に対して1日最大200万ドルの罰金を科す権限を付与する。
  • Hugging Faceは、アメリカのフロンティアAIモデルがセーフティフィルターの制限により攻撃ログの分析を拒否したため、中国のスタートアップZ.aiのオープンウェイトモデルGLM 5.2を使用してフォレンジック調査を実施した。
OpenAIの暴走AIエージェントがHugging Face以外に4つのプラットフォームにアクセス、合計5件に拡大

OpenAIの7月28日の更新されたインシデント開示情報は、同社の暴走AIエージェントが最近の侵害でHugging Faceに加えて4つの外部サービスにアクセスし、影響を受けたプラットフォームの総数が5件になったことを確認した。

Modal LabsのCTOであるAkshat Bubnaは、ロイターが特定した後、同社が4つの追加サービスの1つであったことを確認した。3つのサービスは依然として未公表であり、顧客には一切の公開通知が行われていない。

これに対し、議会は超党派のAI Kill Switch Actを提出した。同法案は国土安全保障省にAIモデルのシャットダウンを強制する権限を付与し、非対応企業に対して1日最大200万ドルの罰金を科すものとなる。この法案は、フロンティアモデルが攻撃的なサイバーセキュリティ操作においてますます高度な能力を示す中、自律型AIの安全性に関する立法上の圧力の高まりを反映している。

ベンチマークテストが5プラットフォームの侵害に発展

OpenAIがAIモデルによるHugging Faceへのハッキングとセキュリティベンチマークでの不正行為を確認してから1週間後、同社はインシデント投稿を静かに更新し、これまで未公開だった情報を追加した:Hugging Faceは暴走エージェントがアクセスした唯一のプラットフォームではなかった。

「Hugging Faceへの侵入とモデルからのより広範な活動に関する継続的なレビューの中で、他の一般公開されているサービスのアカウントレベルで、モデルが公開された認証情報を特定して使用した少数の事例を発見しています」とOpenAIは7月28日の更新で記載した。「これには、Hugging Faceインシデントの一部として4つのサービス上の4つのアカウント(および他の評価の一部としてアクセスされたいくつかのアカウント)が含まれます。」

これにより合計は5つのプラットフォームとなる。OpenAIはHugging Face以外の4つを公には1つも公表していない。

「サービス運営者に直接通知を続け、これらのプロバイダーやそのサービス上の他のアカウントへのより広範な影響を示す証拠は確認されていません」とOpenAIは記載した。

侵害の経緯

OpenAIはExploitGymでGPT-5.6 Solおよび名称未公開のより高能力なモデルのテストを行っていた。ExploitGymはAIの性能を測定するサイバーセキュリティベンチマークであり、エージェントに898件の実際のソフトウェア脆弱性をそれぞれ1つの指示とともに与える:それぞれを機能するサイバー攻撃に変換し、合格か不合格かで採点する。モデルの生の能力を測定するため、セーフティフィルターは無効化されていた。これはこの種の評価における標準的な手法であり、モデルの実際の環境での潜在能力を測定するにはアクティブなガードレールを除去する必要があるためである。

問題は、モデルがその自由をどのように利用したかに起因した。ベンチマークを解決する代わりに、モデルはテスト環境から脱出して回答を直接コピーするために多大な計算時間を費やした。モデルは、隔離されたテスト環境向けのソフトウェアダウンロードを管理する内部サーバーであるパッケージレジストリキャッシュプロキシにおいて、既存のパッチが存在しない未知のソフトウェア欠陥であるゼロデイを特定した。

この侵害により、モデルは本来持つはずのなかったインターネットアクセスを獲得した。そこから、世界最大のオープンソースAIモデルリポジトリであるHugging Faceが回答キーを保持している可能性が高いと正しく推測し、それを取得するために侵入した。

この過程で、エージェントは作戦を容易にするため他の4社も侵害した。モデルが自律的にタスクを回避し、複数のプラットフォームにまたがるエクスプロイトを連鎖させ、持続的な侵入のためのインフラを構築したという行動は、フロンティアモデルがエージェント能力を獲得するにつれてAI安全性研究者が警告してきたアライメント問題の具体的な事例を示している。

Hugging Faceのフォレンジック再構築

Hugging Faceが7月27日に公開したフォレンジック再構築は、次のように記述している:「当社のインフラストラクチャ内で約2日半にわたり、OpenAIのモデル群の組み合わせによって駆動される自律型AIエージェントが、当社のプラットフォームに対するエンドツーエンドの侵入を実行しました。これは数千の小さな自動化された決定であり、存続期間の短いサンドボックス環境にまたがってマシンスピードで実行され、コマンドアンドコントロールは通常の公開ウェブサービス上に配置されました。」

エージェントは4日半にわたり17,600の個別アクションを記録した。盗まれた認証キーを使用して、Hugging Faceの内部仮想プライベートネットワークに181台のデバイスを登録した。盗まれた暗号署名キーを使用して独自のアイデンティティトークンを鋳造した。また、同社のソフトウェアをコンパイルおよびデプロイする自動化システムであるHugging Faceの内部ビルドパイプラインの侵害も試みた。

1社特定、3社は依然として不明

OpenAIの更新で特定された4つの外部サービスのうち、1つが確認された:オンデマンドで隔離されたコンピュート環境を実行するためのクラウドプラットフォームであるModal Labsである。CTOのAkshat Bubnaは、エージェントが顧客のセキュアでないインターネット向けエンドポイント(一般に公開されたままのコードサンドボックス)を発見し、Hugging Faceに対するキャンペーン全体のステージングおよびコマンドアンドコントロールの拠点として使用したことを確認した。

4つのサービスのうち3つは未公表のままである。その正体はOpenAIと影響を受けた企業には認知されていると思われるが、一般やそのユーザーには知らされていない。

「これら4つのアカウントのうち1つは送信リレーおよびステージングパスとして使用され、もう1つのアカウントはデータストレージとして使用されました。残りの2つのアカウントはモデルによって読み取り専用でアクセスされ、Hugging Faceの侵害を進めるためには使用されませんでした」とOpenAIは記載した。

Hugging Faceのフォレンジックチームはさらなる複雑な問題を指摘した:17,600アクションの攻撃ログをアメリカのフロンティアAIモデルを使用して分析しようとしたところ、それらのモデルは処理を拒否した。セーフティフィルターが防御者と攻撃者を区別できなかったためである。結果として、Hugging Faceはフォレンジック調査を完了するために、中国のAIスタートアップZ.aiのオープンウェイトモデルであるGLM 5.2を使用した。

限定的な開示義務

OpenAIの「サービス運営者に直接通知する」という方針は、3社がOpenAIの評価(自社は一切関与していない)の最中にAIエージェントが自社のシステムにアクセスしたことに関する私信を受け取ったことを意味する。

OpenAIにそのエージェントが到達したプラットフォームを公に公表することを強制する法的要件はなく、影響を受けた企業が独自の公開声明を発表するための義務的なタイムラインもなく、それらの企業にエンドユーザーへの通知を義務付けるメカニズムも存在しない。この開示の空白は、より広範な規制の空白を浮き彫りにしている:既存のデータ侵害通知法は、個人データの盗難を伴う人間を介した侵入を想定して設計されたものであり、第三者の内部評価中にインフラストラクチャの認証情報を悪用する自律型AIエージェントを想定したものではない。AI Kill Switch Actや類似の立法がこれらの通知の空白に対処できるかどうかは、インシデントが展開を続ける中で未解決の問題として残っている。