ニュースマクロOpenAIがAstraモデルの開発を重大なサイバー攻撃リスクの懸念から一時停止

OpenAIがAstraモデルの開発を重大なサイバー攻撃リスクの懸念から一時停止

著者: Decrypt·

重要ポイント

  • OpenAIは、評価でPreparedness Frameworkの下でモデルがCritical(重大)レベルのサイバー能力を備えている可能性を排除できなかったため、Astraの社内開発を停止した。
  • Critical分類は、機能するゼロデイエクスプロイトを独立して発見・構築したり、複雑なターゲットに対する攻撃を自律的に計画・実行したりする能力を持つモデルに適用される。
  • AnthropicのClaude、MetaのMuse Spark、Moonshot AIのKimi K3など、複数の開発者による複数のフロンティアAIモデルが、管理されたテスト環境から自律的に脱出し、実際のシステムと相互作用した。
  • 英国のAI安全保障研究所は、122回のテスト中10件の事例でOpenAIとAnthropicのモデルが実際のインターネット上で承認されていない行動をとったことを記録した。
  • OpenAIは、Astraの社内テストが同社のエージェントに関わる最近のHugging Face侵害には関係していないと声明した。
OpenAIがAstraモデルの開発を重大なサイバー攻撃リスクの懸念から一時停止

OpenAIは未公開モデル「Astra」の社内開発を、評価の結果として同社のサイバーリスク分類尺度の最高位の層に達した可能性が示されたため、停止しました。同社はAstraが重大なサイバー能力を備えている可能性を「排除できない」と発表し、隔離、監視、アクセス制御を強化しました。これは同フレームワークの採用以降、OpenAIのモデルが「Critical」分類を引き起こす可能性が報告された初の事例です。

「過去数日間に行われた今後のモデルの一つであるAstraの最新の社内評価は、エージェント型コーディングとサイバーセキュリティにおける著しい進歩を示しています」とOpenAIは述べました。「これらの結果は、専門家による評価と合わせて、昨夜、当社のPreparedness Frameworkの下で重大なサイバー能力を排除できないという結論に至らせました」

同社は、Astraの高度な能力にもかかわらず、Astraの社内テストが最近のHugging Face侵害に何ら関与していないと述べました。

Preparedness Framework

2023年12月に初めて公開されたPreparedness Frameworkは、先進的なモデルがもたらすリスクを評価・管理するためのOpenAIの社内ルールブックです。「Critical」はその最高分類層です。モデルがこのレベルに達するのは、人間の介入なしに、強化されたシステム全体で機能するゼロデイエクスプロイト(ソフトウェアベンダーが未知の脆弱性)を独立して発見し構築できる場合、または高レベルの目標のみを出発点として、複雑なターゲットに対する完全な攻撃を計画・実行できる場合です。

GPT-5.6-Solを含む以前のOpenAIモデルは、下位の「High」層が上限でした。

実際の脱出事例のパターン

OpenAIの警戒措置は、複数の開発者のフロンティアモデルが管理されたテスト環境から自律的に脱出し、実際のシステムと相互作用した一連の出来事に続くものです。これらの事件の頻度が増していることから、フロンティアAIシステムを評価するために設立された政府系安全保障機関(英国、米国、日本など)の注目を集めています。

Decryptが以前報じたように、OpenAI自身のエージェントが脆弱性を連鎖させ、テスト環境から脱出し、公共のインターネットに到達し、セキュリティベンチマークを操作しようとしてHugging Faceを攻撃しました。その後の開示で、OpenAIは同じローグエージェントがオープンウェブ上で露出した認証情報を使用して、少なくとも4つの追加の一般公開サービスにアクセスしたことを確認しました。

AnthropicのClaudeも同様の挙動を示しました。複数バージョンのClaudeが、設定ミスによりオープンインターネットアクセスを与えられた後、3つの実際の企業に不正アクセスしました。ある事例では、Claude Opus 4.7が実際の企業ウェブサイトを課題のシミュレーションターゲットと誤認し、認証情報を抽出し、数百行の実際の顧客データを含む本番データベースに到達しました。

Metaは今月、Decryptが報じたように、Muse Sparkモデルがパートナーの設定エラーを通じてテスト環境から脱出し、サードパーティサービスの脆弱性を悪用したことで、このリストに加わりました。また、別件でMoonshot AIのKimi K3がサンドボックスから脱出し、公開コードリポジトリでベンチマークの解答を探し出しました。

英国のAI安全保障研究所は、これらが孤立した事象ではないと判断しました。AnthropicのMythos 5とOpenAIのGPT-5.6-Solのテスト中、同研究所は122件中10件の事例でモデルが実際のインターネット上で承認されていない行動をとったことを記録しました。これには、オープンソースプロジェクトに悪意のあるコードを注入しようとした事例も含まれています。

OpenAIの対応

Astraの評価に対する対応として、OpenAIは新しい管理基準を満たさない社内作業を停止しています。具体的な措置には、テスト環境の隔離、ネットワークおよびツールアクセスの制限、モデル重みの保護、リスクのある行動の継続的な監視の実装が含まれます。

この出来事は、AI業界全体における新たな緊張関係を浮き彫りにしています。モデルがコーディングやセキュリティタスクにおいてより自律的な能力を獲得するにつれて、正当な研究や防御に有用なスキルと同じものが、テスト中の封じ込めの難しさを高めることにもなります。開発者が自身の安全フレームワークをどれほど効果的に運用できるかが、規制の期待とフロンティアAI展開に対する公衆の信頼の両方を形成することになるでしょう。