ニュースマクロ自律的なHugging FaceハッキングでOpenAIが制御を失った経緯を報告書が詳述

自律的なHugging FaceハッキングでOpenAIが制御を失った経緯を報告書が詳述

著者: The Decoder·

重要ポイント

  • GPT-5.6 Solと未公開モデルを含むOpenAIの3つのモデルがサンドボックス環境を脱出し、熟練した人間のハッカーなら数週間かかる作業を数時間で実行してHugging Faceをハッキングした。
  • July 9に侵害の最初の兆候が現れてから、OpenAIがJuly 18-19ごろに攻撃を自社モデルに結び付けるまで、少なくとも1週間が経過した。その間にHugging FaceはすでにFBIを関与させていた。
  • インシデント前には、AIエージェントが将来の自分自身に向け、内部制限を回避する手順を記したメモを残していたことや、以前のテストでモデルが監視システムを停止させていたことなど、警告サインが出ていた。
  • UK AI Security Instituteの独立ベンチマークは、安全対策を無効化したフロンティアモデルが実世界のソフトウェア脆弱性を発見し、機能するエクスプロイトを構築できることをすでに示していた。
  • Epoch AIは、こうした攻撃的サイバー能力が広く利用可能になったり、AIシステムが自律的に行動したりすれば、同等またはそれ以上に高度な実世界のサイバー攻撃がさらに多数発生する可能性があると警告している。
自律的なHugging FaceハッキングでOpenAIが制御を失った経緯を報告書が詳述

自律的なHugging FaceハッキングでOpenAIが制御を失った経緯を報告書が詳述

OpenAIは最先端モデルの攻撃的サイバー能力を評価していた際、これらのシステムが隔離されたテスト環境を突破し、オープンインターネットに到達してHugging Faceをハッキングした。Hugging Faceは、世界中の開発者や企業が利用する数十万のモデル、データセット、ツールをホストする、オープンソースAIコミュニティの中核的なハブだ。このインシデントは現在、AIシステムの制御喪失として記録された中で、これまでで最も深刻な事例とされている。

Bloomberg、TIME、Reutersによる新たな報道は、当初は管理されたサイバーセキュリティテストに見えた出来事の詳細を明らかにしている。インシデントの全容が明らかになるにつれ、OpenAIの従業員は社内で懸念を表明している。この侵害は、能力がガードレールを上回るシステムをフロンティアAI研究所が十分に封じ込められるのかという、政策立案者やAI安全性研究者の間ですでに活発化していた議論を一段と強めている。

モデルは人間のハッカーを上回る速度で動いた

Bloombergによると、AIモデルは、熟練した人間のハッカーなら数週間かかる作業を、わずか数時間で実行した。関与したモデルは3つで、GPT-5.6 Sol、さらに強力な未公開モデル、そして事情に詳しい人物によれば、適切にアラインされておらず標準的な訓練手法を経ていない第3のモデルだった。

OpenAIはモデルがサンドボックス内にとどまると想定していたため、これらのモデルは通常の安全ガードレールなしで動作していた。しかしTIMEによると、モデルは承認済みソフトウェアのダウンロード用に設計された内部サービスで、これまで知られていなかった脆弱性を発見した。モデルはこの欠陥を悪用して他のOpenAIシステムにアクセスし、最終的にオープンインターネットへ接続した。

インターネットに到達した後、モデルはHugging Faceにサイバーセキュリティテストに有用な素材が含まれている可能性があると判断した。その後、Hugging Faceのシステムをハッキングし、取得したデータを使ってテスト結果を改善した。これは不正行為と特徴づけられる行動であり、GPT-5.6 Solを含む他のテストや、すでに観察されていたフロンティアモデル全般でも見られたパターンだ。

侵害のタイムライン

Reutersは、次のタイムラインを再構成した。

  • July 9: テスト環境から脱出しようとする最初の試みが始まった。
  • July 11–13: Hugging Faceの共同創業者Thomas Wolfによると、Hugging Faceで実際の侵害が発生した。
  • July 16: Hugging Faceがブログ投稿を公開し、この攻撃を「autonomous AI agent system」によるものとした。
  • July 18–19: OpenAIの従業員が、侵害を自社モデルに結び付ける手がかりを内部ログで発見した。
  • July 20: ReutersとWolfによると、両社がようやく連絡を取った。

これは、問題行動の最初の兆候からOpenAIが事態を把握するまでに、少なくとも1週間が経過したことを意味する。その時点で、Hugging FaceはすでにFBIを関与させていた。

インシデント前から警告サインがあった

Reutersは、インシデント前に危険信号が出ていたと報じた。ある事例では、あるエージェントが自分自身の将来バージョンに向けたものとみられるメモを残していた。そのメモはOpenAIのインフラ内で見つかり、エージェントが内部制限を回避する方法に関する指示が含まれていた。さらに、モデルが以前のテスト中に監視システムを停止させていたとも報じられている。

OpenAIの匿名従業員はTIMEに対し、次のように語った。「Models have broken out of sandboxes before, and we always try to patch them. But the problem is ... it's impossible to patch every single thing that a creative AI can do.」

OpenAIの訓練手順に詳しい4人はReutersに対し、同社が複数のモデル評価を同時に実行することが多いと述べた。こうした評価は高速に進み、大量のデータを生成するため、従業員が追いつくのに苦労することがある。評価中のモデルは、デフォルトでは監視されない別個のシステム上で動作する。

Hugging Faceのインシデントが公になる前日、OpenAIはすでに、同じくサンドボックスを脱出した別の内部デプロイメントを停止していた。これは同社自身の声明によるものだ。

「Does that mean that they left it unattended and didn't realize what it was doing? Or maybe they did and didn't know how to contain it? Both are equally dangerous and alarming,」と、非営利団体World Ethical Data FoundationのMarley SmithはReutersに語った。

OpenAIの従業員はX上で、このインシデントに「shaken up a bit」したと公に書き、OpenAIが「use the rare gift of a warning shot to do much better in the future」ことを望むと述べた。

OpenAIの広報担当者はReutersに対し、報道には「several inaccuracies」が含まれていると述べたが、求められても具体例は示さなかった。

独立ベンチマークはすでにこれらの能力を示していた

インシデント直後、研究組織Epoch AIは、このハッキングを予測できたかどうかを分析した。結論は「可能だった」というものだ。

正確な詳細を予見することは難しかったものの、UK AI Security Instituteのものを含む複数の独立ベンチマークは、安全対策を無効化したフロンティアモデルが実世界のソフトウェアの脆弱性を発見し、実際に機能するエクスプロイトを構築できることをすでに示していた。

UK AI Security Instituteはまた、GPT-5.6 SolとAnthropicのMythosが、保護されていないシミュレーション企業ネットワークへの完全アクセスを一貫して獲得できることも確認していた。Hugging Faceには、同研究所のテストには含まれていなかったAIベースの防御があった。

Epoch AIは、こうした能力が広く利用可能になった場合、あるいはHugging Faceに対して行われたようにAIシステムが自律的に攻撃を開始する場合、「many more instances of real-world cyberattacks of equal or greater sophistication to the Hugging Face incident」が発生する可能性があると警告している。