ニュースマクロOpenAI、開発段階で第三者団体によるAIモデルの安全性審査を許可へ

OpenAI、開発段階で第三者団体によるAIモデルの安全性審査を許可へ

著者: CryptoBriefing·

重要ポイント

  • •OpenAIは9月22日、独立系の評価者がAIモデルを開発のより早い段階で審査すると発表し、安全性の検証をリリース前段階から上流に移した。
  • •拡充されたプログラムは4つの領域に焦点を当てる:セーフティケース、敵対的脅威に対する安全策の耐性、Preparedness Frameworkに基づく壊滅的リスク評価、およびアライメント不全インシデント。
  • •セーフティケースとPreparedness Frameworkは内部で作成されるため、外部の審査員に開することは、OpenAI自身のリリース前リスク判断に対する外部チェックとなる。
  • •OpenAIは、科学的厳密性、評価者の独立性、セキュリティプロトコル、調査結果の責任ある公表方法を網羅する7つの指針を公表した。
  • •正式なパートナーは still 発表されておらず、サム・アルトマンの9月12日の公約を受けて、METRおよびRedwood Researchと協議が進み、アクセス条件は協議中である。
OpenAI、開発段階で第三者団体によるAIモデルの安全性審査を許可へ

OpenAIは9月22日、独立系の団体がAIモデルを開発のより早い段階で調査できるようにすると発表した。この変更は、モデルがほぼ完成した後ではなく、展開前に安全性の問題を表面化させることを目的としている。

拡充された評価プログラムの下で、独立系の審査員は4つの優先領域に注力する。第一に、OpenAIの「セーフティケース」—特定のモデルが展開に安全であるとする同社自身の論拠—を評価する。第二に、評価者は敵対的脅威に対する重要な安全策の耐性を検証する。第三に、評価は、リリース前に壊滅的リスクを測定するために同社が使用する内部システムであるOpenAIのPreparedness Frameworkに直接結び付けられる。第四に、評価者はアライメント不全インシデントを調査する。このカテゴリーは、Hugging Faceに関わる情報漏洩が、こうした失敗がいかに急速に拡大し得るかを浮き彫りにした後、緊急性を増した。

セーフティケースとPreparedness Frameworkはいずれも内部で作成されるものであるため、これらを外部の審査員に開放することは、リリース前にOpenAI自身がリスクをどのように判断するかに対する外部チェックを加えることになる。

OpenAIはまた、これらの評価の実施方法を定める7つの指針を公表した。指針は、科学的厳密性、評価者の独立性、セキュリティプロトコル、および調査結果の責任ある公表方法を重視している。同社は、これまで安全性の取り組みでOpenAIと協力してきたMETRやwood Researchを含む組織と協議を進めている。新たなパートナーは正式に発表されておらず、具体的なアクセス条件は still 協議中である。その条件がどのように確定するかは、評価者が実際にどの程度のアクセスを得るかを左右することになる。

この取り組みは、9月12日にCEOサム・アルトマンが示した公約に基づくものであり、彼はその際、評価者がOpenAIの運営体制により深く組み込まれることを示唆した。

OpenAIの安全性へのアプローチはどのように進化してきたか

OpenAIの安全プロトコルは、GPT-4の時代、すなわち同社が初めて外部のレッドチームにリリース前のモデルの検証を招き入れた時期から大幅に拡大してきた。それ以前の取り組みは範囲がより限定的で、主にリリース直前の最終段階に焦点が当てられていた。新しいフレームワークは、その関与を開発タイムラインの大幅に上流へと移し、リスクに対処する時間が still 残っている段階で評価者がリスクを特定できるようにする。

人材と競争上の考慮事項

AI安全性研究のコミュニティは比較的小さく、METRやRedwood Researchのような組織はこの分野で最も信頼性の高い存在である。こうした団体との関係を深めることで、OpenAIは実務上の専門知識と評判上の資本の両方を得る。評価者にとっても、この取り決めは、通常は外部からは見えない最先端システムへのアクセスという、同様に価値のあるものを提供する。

このプログラムの信頼性は、独立系の評価がOpenAIの商業的利益に反する調査結果を明らかにした場合に何が起こるかに部分的にかかっている。7つの指針は責任ある公表方法を明示的に求めているが、透明性と競争優位の間の緊張は still 残っている。OpenAIがこの緊張に信頼性をもって対応できれば、このプログラムは業界全体の安全基準の雛形となり得る。注目すべき短期的な指標は具体的である。どの組織が正式にパートナーとして名を連ねるか、最終的にどのようなアクセス条件で合意するか、そして初期の調査結果がどのように開示されるかである。