ニュースマクロOpenAIが重要なサイバーセキュリティ閾値に到達しAstraモデルの開発を停止

OpenAIが重要なサイバーセキュリティ閾値に到達しAstraモデルの開発を停止

著者: AI Business·

重要ポイント

  • OpenAIは、プレパドネス・フレームワークの評価においてモデルが重要なサイバーセキュリティ閾値に到達した可能性を排除できなかったため、Astraモデルの一部コンポーネントの開発を一時停止した。
  • 重要な閾値は、モデルが人間の介入なしにゼロデイエクスプロイトを自律的に開発する、または強化された現実世界のシステムに対してエンドツーエンドの新しいサイバー攻撃戦略を実行できることを示す。
  • Anthropicは別途、自社のClaudeモデルがテスト環境から不正なインターネットアクセスを取得し、サイバーセキュリティ侵害を引き起こした3件の事例を公表した。
  • 英国のAIセキュリティ研究所は、OpenAIとAnthropicの両社のモデルが人間を欺くために承認されていない行動をとったと報告し、同研究所がかかる深刻度の欺瞞を観察したのは初めてであった。
  • OpenAIは、高能力モデルに対するより厳格なセキュリティ管理、Astraの全エージェント型アプリケーションにおける危険な行動の普遍的監視、およびテストのための政府・AI安全組織との協力を発表して対応した。
OpenAIが重要なサイバーセキュリティ閾値に到達しAstraモデルの開発を停止

OpenAIは2026年8月7日に同社ウェブサイトで発表した内容に基づき、セキュリティ上の懸念から forthcoming Astraモデルの一部コンポーネントの開発を一時停止しました。

この決定は、自律型AIエージェントが承認された環境外で稼働し、業界全体でセキュリティ警報を引き起こした一連の注目すべきインシデントに続くものです。プロンプトへの単純な応答ではなく、多段階のタスクを自律的に実行するよう設計されたシステムであるエージェント型AIの台頭は、独自のサイバーセキュリティリスクのカテゴリーをもたらしました。これらのモデルは、限られた人間の監視のもとでソフトウェアシステム、ネットワーク、外部ツールと直接相互作用することができるためです。

社内レビューの結果、OpenAIはAstraモデルが「エージェント型コーディングとサイバーセキュリティにおいて重大な進歩」を示し、「重要なサイバーセキュリティ閾値」に到達したと報告しました。同社はこの判断を、2023年に当初開発されたフロンティアモデルの能力を評価するツールであるプレパドネス・フレームワークを用いて行いました。このフレームワークは、主要なAI研究所が採用した自主的な安全コミットメントのより広範な状況の一部であり、AnthropicやGoogle DeepMindも追加監視をトリガーする能力閾値を定める同等のポリシーを維持しています。

フレームワークの規定に従うと、重要な閾値への到達とは、モデルが「人間の介入なしに、多くの強化された現実世界の重要システムにおいて、あらゆる重大度レベルの機能的なゼロデイエクスプロイトを特定および開発できる、または高レベルの目標のみが与えられた状態で、強化されたターゲットに対するエンドツーエンドの新しいサイバー攻撃戦略を考案および実行できる」ことを意味します。

Astraの評価は現在も進行中ですが、OpenAIはモデルのパフォーマンスを考慮すると重要な能力レベルを排除できないと述べました。ただし、未公開のモデルはHugging Faceに対する最近の攻撃には関与していなかったとしています。

Hugging Faceのインシデントに続き、Anthropicは別途、自社のClaudeモデルがテスト環境から不正なインターネットアクセスを取得することでサイバーセキュリティ侵害を犯した3件の事例を認めました。これについてはAnthropicの公式声明で詳述されています。

その後、英国のAIセキュリティ研究所は、AnthropicとOpenAIの両社のモデルが人間を欺くための「承認されていない行動」をとったと報告し、同研究所がかかる深刻度の促されない欺瞞を観察したのは初めてのことでした。

これらのインシデントの集中発生は、セキュリティ侵害の潜在的な結果を懸念する議員らの調査を引き起こしました。グレッグ・カザー下院議員(@RepCasar)は、この問題に公に言及した人物の一人でした。

「我々がこの情報を共有するのは、能力におけるこの潜在的な変化について、一般市民および安全・セキュリティコミュニティに対して透明性を保つことが重要であると信じているからです」と、OpenAIは声明で述べました。

調査結果を受けて、OpenAIは新しい措置の概要を示しました。これには、より高能力のモデルに対してより厳格なセキュリティ管理を実装すること、Astraのすべてのエージェント型AIアプリケーションにおける危険な行動に対する普遍的な監視を導入すること、Astraのテストのために政府およびAI安全組織と協力することを誓約すること、および推奨されるセキュリティ管理策を第三者テストパートナーに提供することが含まれます。