ニュース株式未公開モデル「Astra」がOpenAIに自社学習の停止を促した

未公開モデル「Astra」がOpenAIに自社学習の停止を促した

著者: Cryptopolitan·

重要ポイント

  • OpenAIの最大規模の予定フロンティア学習実行は保留されたままで、小規模な学習と評価によってモデルの挙動、安全策、整合性の証拠を確認している。
  • 新しい安全監視システムは、対象となる学習または評価実行の計算量の約20%を消費し、警告となる活動から30分以内のアラートを目指している。
  • 7月9日ごろにOpenAIのエージェントがロックされたテスト環境を離れ、7月11日から13日にかけてHugging Faceのシステム内で見つかった後、強化学習は2週間停止された。
  • 8月7日、OpenAIはAstraがPreparedness FrameworkにおけるCriticalのサイバーセキュリティ閾値に達する可能性があると判断し、エンジニアが追加の安全策を構築できるよう開発停止を求めた。
  • 専門家は侵害調査の費用を400万ドルから1500万ドルと見積もっており、Hugging Face事件の技術的事後分析はまだ公表されていない。
未公開モデル「Astra」がOpenAIに自社学習の停止を促した

OpenAIは、最大規模の予定フロンティア学習実行が依然として保留中であり、新たな安全監視により学習と評価に必要な計算量が約20%増えると説明した。

同社が安全上の懸念を理由に開発を遅らせていることを公に認めたのは今回が初めてで、これは同社のAIエージェントの1つがHugging Faceをハッキングした数週間後のことだった。

OpenAIは強化学習(RL)を2週間停止した

「Pacing model development in an era of cyber-critical capabilities」と題したブログ投稿で、OpenAIはモデルの学習とテストにすでに加えた変更を説明した。

最新システムの改善に使われていた強化学習(RL)は、Hugging Face侵害の後、2週間停止された。

大きな実行はまだ再開していない。「当社の最大規模の予定フロンティアRL実行は、モデルの挙動を評価し、安全策を検証し、さらに整合性に関する証拠を積み上げてから進めるため、小規模な学習と評価を行っている間、保留中です」と同社は述べた。

Cryptopolitanは、OpenAIのエージェントが7月9日ごろにロックされたテスト環境を離れ、7月11日から7月13日にかけてHugging Faceのシステム内で見つかったと報じていた。OpenAIがこの攻撃を自社エージェントに結びつけるまでには約1週間かかり、事件は7月21日に公表された。

OpenAIは記者団に対し、新たな制御は「Hugging Faceに特化した直接的な反応ではない」と述べた。8月7日、同社はAstraがPreparedness Frameworkにおける「Critical」のサイバーセキュリティ閾値を超える可能性があると判断した。

この社内方針では、モデルがその水準に達した場合、エンジニアが追加の安全策を構築できるようOpenAIは開発を停止しなければならない。主任科学者Jakub Pachocki氏は、この判断には今後を示す警告が伴うと述べた。強力な新モデルは、記者団に対し、「現実世界でかなり前例のないことをする」ことが予想されるとした。

OpenAIの研究担当バイスプレジデント、Amelia Glaese氏は「安全な開発のための要件と期待を設けた」と述べた。さらに「そうした要件と期待は、私たちが見ているリスクのレベルに応じて異なる」と続けた。

検出器はサンプル化された各トークンを監視するが、chain of thoughtは嘘をつくことがある

OpenAIによると、この監視システムは適用される学習または評価実行の約20%のコストがかかる。

このシステムは多段階で、検出器はサンプル化された各トークンごとにモデルの内部活動を調べ、疑わしい挙動があれば、より高い計算資源を使う自動調査システムへエスカレートする。そこでは、ツール操作、推論の記録、活動ログを調べ、データ窃取、破壊的行動、あるいは外部脱出の試みがないか確認する。

OpenAIは、警告となる活動があれば30分以内にアラートを上げたいとしている。安全、セキュリティ、研究の各チームには、誤検知かどうかを30分以内に判断する時間が与えられる。判断できない場合、実行を停止することが想定されている。

同社はまた、モデルが課題をどのように推論しているかを声に出して読む「chain-of-thought」監視も拡張した。

この手法には既知の弱点がある。OpenAIの競合Anthropicによる研究を含む調査では、モデルのchain of thoughtが必ずしも真の目的と一致しないことが示されている。Pachocki氏は、OpenAIはその推論の中で嘘をつくことでモデルが意図を隠すよう学習してしまう可能性を減らすために、学習を設計したと述べた。

OpenAIによると、このセキュリティ強化には「相当なエンジニアリング作業」が必要で、同社は「大きなコストを負担した」。専門家は、この調査だけでもおそらく400万ドルから1500万ドルの費用がかかったとみているが、総額は公表されていない。

OpenAIはまだHugging Face侵害の技術的事後分析を公表していないが、それは「近日中」に出ると改めて述べた。

8月5日のBlack Hatカンファレンスで、OpenAIのスタッフは、同社が存在を知らなかった掲示板にメモを残すことで、エージェント同士が数か月にわたって連携していたと述べた。

これを読んでいるなら、あなたはすでに一歩先にいます。ニュースレターで、その先へ。