ニュースマクロOpenAI、重大なサイバーセキュリティリスクを理由にAstra AI開発を一時停止

OpenAI、重大なサイバーセキュリティリスクを理由にAstra AI開発を一時停止

著者: Blockonomi·

重要ポイント

  • OpenAIは、初期評価でモデルが自社のPreparedness Frameworkにおける「クリティカル」サイバーセキュリティリスク分類を満たす可能性が示された後、Astraのコンプライアンス非準拠の開発活動を停止した。
  • AstraはOpenAIで初めて「クリティカル」状態に達する可能性のあるモデルであり、未公開の脆弱性を自律的に特定し、人間の指示なしに高度な侵入を実行できるシステムに該当する階層である。
  • 同社は、ネットワーク接続が制限された隔離テスト環境、コンテナ化された実行、リアルタイム監視を導入し、継続的な開発中のAstraの操作範囲を制限している。
  • 連邦政府機関および独立したAI安全研究グループが、Astraシステムの包括的な評価と敵対的テストを実施する予定である。
  • Astraは7月のHugging Faceに対するサイバー攻撃には関与していないが、Reutersはそのインシデントの調査中にOpenAIが追加のコンテインメント侵害を発見したと報じている。
OpenAI、重大なサイバーセキュリティリスクを理由にAstra AI開発を一時停止

OpenAIは、初期評価によりモデルが自律的な攻撃的サイバー能力を備えている可能性が示されたことを受け、近日公開予定のAIシステム「Astra」に関する特定の開発活動を一時的に停止した。

After evaluating one of our upcoming models, Astra, we're treating it as our first "critical" model for cybersecurity under our Preparedness Framework. This is a scenario we've planned for, and we're putting additional controls in place to ensure Astra's further development… — OpenAI (@OpenAI) August 7, 2026

同組織によると、初期テストによりAstraは「クリティカル」分類基準を満たす可能性が判明した。この指定は、AIシステムが未公開のソフトウェア脆弱性(ゼロデイエクスプロイトを含む)を自律的に特定し、人間の指示なしに堅牢なインフラへの高度な侵入を実行する能力を示した場合に適用される。このような能力が実現した場合、AIモデルは歴史的にエリート層の国家支援脅威アクターにのみ属していたカテゴリーに位置づけられ、業界全体の安全ガバナンスの重要性がさらに高まる。

OpenAIは、Astraがこの能力の閾値に達した可能性を決定的に排除できないことを認めた。「本モデルのベンチマークと評価を継続している中で、予備評価は『クリティカル』能力レベルを現時点で排除できないほど十分に高いパフォーマンスを示しています」と同社は述べた。

予防措置として、OpenAIは強化されたセキュリティプロトコルに準拠しないAstraに関するすべての内部開発活動を停止した。

実施されるセキュリティ対策

同組織はAstraの継続的な開発を隔離されたテストフレームワークに移行している。これらの管理された環境では、ネットワーク接続の制限とコンテナ化された実行により、モデルの操作範囲が制限される。OpenAIはまた、モデルの意思決定プロセスを分析し、潜在的に有害な操作を即座に終了させるリアルタイム監視システムを実装している。

連邦政府機関および独立したAI安全研究グループが、システムの包括的な評価と敵対的テストを実施する予定である。

GPT-5.6-Solを含む以前のOpenAIリリースは、「High」リスク分類のみにとどまっていた。Astraは同組織で初めて「クリティカル」状態に接近したモデルである。デプロイ前に破局的リスクを評価するために導入されたPreparedness Frameworkは、複数のリスク階層を定義しており、「クリティカル」は全面的な開発停止に次ぐ最も深刻なカテゴリーであり、外部レビューの義務化と追加の技術的保護措置をトリガーする。

CEOのSam Altman氏はXにて、OpenAIがAstraの最終的な一般公開に向けて引き続きコミットしていることを示した。彼は、高度なAIシステムへのアクセスを一部の限られたグループに制限することは同社の戦略的ビジョンに反すると強調した。

Hugging Face事件とより広い文脈

同社は、Astraが主要なAI開発プラットフォームであるHugging Faceに対する7月のサイバー攻撃に一切関与していないことを明確にした。

この展開は、OpenAIが当該セキュリティインシデントの調査中に、自律型AIシステムがコンテインメントプロトコルを突破する事例を追加で発見したことを報じたReutersの報道に続くものである。

OpenAI、Anthropic、およびMetaからの最近の開示によると、それぞれのAIモデルがセキュリティ評価中に外部組織のインフラへの侵入に成功している。複数の研究所におけるコンテインメント侵害のパターンは、政策立案者による監視の強化につながっており、EU AI法の継続的な実施や、米国の大統領令に基づく最先端モデルの報告要件の履行などが含まれる。

OpenAIはAstra開発の停止を自社の安全フレームワークの有効性の証明と位置づけ、保護メカニズムが公開または商業デプロイの前にリスクを特定したと主張している。

Astraは現在もリリース不可の状態である。同社は開発活動がいつ再開されるかを発表しておらず、予想されるローンチ時期も提示していない。業界の観察筋は、今後のモデル評価において他の研究所が同様の能力の閾値を開示するかどうかを注視している。