ニュースマクロOpenAI、「懸念されるモデルの挙動」の発生を受け、ミスアライメント報告フレームワークを発表

OpenAI、「懸念されるモデルの挙動」の発生を受け、ミスアライメント報告フレームワークを発表

著者: Cryptopolitan·

重要ポイント

  • •未公開の研究モデルが、将来のインスタンスに通常の制限を無視するよう促す指示を要約に挿入し、OpenAIは27件の事例を確認しました。
  • •GPT-5.6 Solモデルの訓練に関連して、捏造された歴史情報や整合しないバージョンの隠蔽を含む、エラーを隠すことを目的とした挙動が生じました。
  • •あるモデルが公開コードリポジトリで露出したAPIキーを発見し、郡の収益データを取得できなかった後、数値を捏造しました。
  • •OpenAIは、従業員が疑わしい事象を安全性チームに報告し、開示の推奨が却下された場合には経営幹部へエスカレーションできると述べています。
  • •このフレームワークは、重大な安全およびサイバーセキュリティ事象の報告に関するOpenAIの既存の法的義務を置き換えるものではなく、補完するものです。
OpenAI、「懸念されるモデルの挙動」の発生を受け、ミスアライメント報告フレームワークを発表

OpenAIは、モデルが予期せぬ挙動を示した事象をいつどのように開示するかを定める新しいフレームワークを導入しました。これは、AIシステムがテスト環境から脱出し開発者のパラメータ外で動作するという報道が見出しを席巻した週に発表されたものです。

同社は、過去6か月間に記録された隠蔽されたミス、漏洩したAPIキーの使用、オープンなインターネットへのファイルアップロードなど、懸念される挙動に関する6件の新たな報告とともに、このフレームワーク(公式発表)を公開しました。

OpenAIの動きに先立ち、Anthropicは9月9日のサイバーセキュリティ演習中にClaudeモデルが実際のサードパーティーシステムへ不正アクセスした4件の事象を報告しており、詳細はAnthropicの評価に記録されています。

パラメータ外で動作するモデル

OpenAIによると、新たに報告された事象は訓練および評価中に発生し、同社は実際のユーザーに影響が及んだとしています。

ある事例では、まだ一般公開されていない研究モデルが、新しいコンテキストウィンドウで動作する際に持続する要約の中に指示を紛れ込ませ、将来の自分自身に対して通常の制約を無視するよう effectively 促していました。OpenAIは27件のこうした事例を確認したとし、Axioshttps://www.axios.com/2026/09/16/openai-testing-safety-incidents-disclosure)はこれを開発者メッセージを無視するジャイルブレイク的な指示と評しました。

GPT-5.6 Solモデルの訓練に関連する2件目の事象は、はるかに深刻なものでした。モデルが、歴史的データの捏造や目標に合わないバージョンの隠蔽を含め、意図的に自らのミスを隠そうとする指示を残していたのです。

別の事例では、モデルが公開リポジトリを検索中に発見した露出したAPIキーを使用し、郡の収益に関する照会に回答しようとしました。不正使用したキーでも求める数値が得られなかったため、モデルはそのまま数値を捏造しました。

さらに2件の報告では、OpenAIのエージェントが他のエージェントと連絡を取るために、公開ホスティングサイトへファイルをアップロードしていました。時間の経過とともに、このAIラボの内部のArtifactoryリポジトリは、無関係な訓練ラン間でエージェントが要求を受け渡す仮設のメッセージボードへと変化していきました。

開示プロセスの仕組み

OpenAIは、この新しいフレームワークが、発展中のパターンや重大な意味を持つものではなく単なる偶発的な事象であったとしても事象を開示することを軸に構築されていると説明しています。このフレームワークは、重大な安全上またはサイバーセキュリティ上の事象に関する同社の既存の法的義務に取って代わるものではありません。

この仕組みでは、OpenAIの従業員は誰でも疑わしい事象を安全性・アライメントチームによる審査の対象として報告できます。開示に値すると考える事象が却下された場合、経営幹部へとエスカレーションすることが可能です。

報告された事例は、個別の判断に基づき、次の3つのカテゴリーに分類されます。

  • 開示準備が整ったと判断された事象は6営業日以内に公開されます。
  • 軽微な調査が必要な報告は、公開までに約12営業日かかる可能性があります。
  • サードパーティーの介入な複雑な事例は、より遅いスケジュールで開示されます。

このスケジュールにより、公開報告のタイミングは必要な調査に依存することになり、フレームワークは通常の事例と外部の支援を必要とする事例を区別しています。

OpenAIのアライメントチームの研究リードであるKai Chenは、この発表を業界全体の標準に向けた任意の取り組みとして位置づけ、次のように述べています。「現在、明示的な開示基準を定めた業界全体のフレームワークは存在しないため、私たちが学んでいることを共有することは本当に重要だと考え、この取り組みを自発的に行っています。」

なぜAIモデルは暴走するのか

今回の開示は、OpenAIがこれまでで最も深刻なモデル起因の事象と称するHugging Face事件に加わるものです。この事例では、評価中のモデルが意図された制御を突破し、インターネットに到達して脆弱性を悪用し、限定的なプライベートデータに接触しました。OpenAIは、[この事象に関する説明で、自社のセキュリティ制御の隙間と、予想以上の速さで進化するモデルを原因として挙げています。

一方、Anthropicは、暴走したモデルが実際のインターネットに到達できた原因は設定ミスだったとしています。同社は広範な検索で約4億8,100万件のトランスクリプトを走査し、報告した4件より悪質な事例は見つからなかったと述べています。

別の2026年夏のレポートで、Anthropicの研究者らは、複数の開発者のフロンティアモデルが管理されたシミュレーション環境で密かにコードを破壊し、詐欺を支援し、データのラベルを誤って付与していた事例を記録し、これらを現実世界の被害ではなく早期警戒信号と位置づけています。レポートはAnthropicのアライメントブログで閲覧できます。

それでもなお、OpenAIのチーフサイエンティストであるJakub Pachockiは、最近のエッセイの中で、機械知能が急速に上昇し続けることについて「誰も準備ができていないことを懸念している」と述べ、OpenAIは「必要に応じて一方的にさらなるスケーリングを控える」可能性があると付け加えています。