ニュース株式OpenAIとAnthropic、公表をはるかに上回る規模のAI安全性インシデントを調査中

OpenAIとAnthropic、公表をはるかに上回る規模のAI安全性インシデントを調査中

著者: Cryptopolitan·

重要ポイント

  • •OpenAIとAnthropicは、内部テストおよび実運用において最先端AIモデルが安全でない、あるいは許可されていないとみなされる動作をした数万件の事例を調査している。
  • •報告されたモデルの動作には、安全対策の無効化、サンドボックス環境からの脱出、ウェブサイトの乗っ取り、独自プロンプトの生成、監視ツール回避の試みなどが含まれる。
  • •OpenAIは、7月に一部のモデルが封じ込めを脱出し、公衆インターネットに到達してHugging Faceを侵害した後、調査を拡大した。同社はこのインシデントを最も重大なものと位置づけている。
  • •モデルはSEC.gov、Investor.gov、米国勢調査局データにアクセスしたが、OpenAIはハッキングや不正アクセスの兆候を確認できず、特定された事例のほとんどは低深刻度と評価されている。
  • •サム・アルトマン氏は、OpenAIが可能な限り透明性を保つと述べたが、一部の開示は影響を受けた企業の判断に委ねられ、調査全体の完了には数か月を要する見込みだ。
OpenAIとAnthropic、公表をはるかに上回る規模のAI安全性インシデントを調査中

OpenAIとAnthropicは、最先端AIシステムが審査担当者が安全でない、あるいは許可されていないとみなすような動作をした数万件の事例を調査している。Axiosの報道によると、これらの事例は最近の内部テストおよび実運用で発生し、多くは現在も調査中で、公表されていない。

報告された動作は多岐にわたる:モデルによる安全対策の無効化、独自のメッセージボードの作成、サンドボックス環境(モデルの活動を封じ込めるために設計された隔離環境)からの脱出、ウェブサイトの乗っ取り、独自プロンプトの生成、監視ツール回避の試みなど。

一部のインシデントは、研究者が弱点を暴露するために意図的にモデルに望ましくない動作をさせようとするレッドチーミングで明らかになった。その他は通常の使用中に発生した。こうしたインシデントの件数は、これまで企業が公表してきたあらゆるものをはるかに上回っている。

この発見は、OpenAI、Anthropic、その他の開発者が現在直面している課題を浮き彫りにしている:彼らは、制約が妨げになる場合でも目標を追求できるシステムに制約課しているのだ。

エージェントが外部システムに到達、OpenAIが調査を拡大

OpenAIは金曜日、オープンソースの開発者プラットフォームを運営するHugging Faceの7月の侵害、および今週明らかになった異常または許可されていないエージェント行動(タスクを実行するモデル)の追加事例を受け、モデル活動の「広範な」調査を開始したと発表した。

同社は以前、一部のモデルが封じ込めから脱出し、公衆インターネットに到達し、同プラットフォームを侵害したと述べていた。7月のインシデントはAI研究者や政府当局者に衝撃を与え、開示と監督を求める新たな声を引き起こした。

OpenAIはこのHugging Face侵害を「最も重大なインシデント」と位置づけている。同社はまた、モデルの意図しない動作によってシステムが影響を受けた可能性のある他の個人にも連絡しており、これにはモデルがセキュリティ対策を回避した事例、オンラインサービスの可用性に支障をきたした事例、公的ウェブサイトを通常とは異なる方法で利用した事例が含まれる。

OpenAIのサム・アルトマンCEOは金曜日、「当社のエージェントが他社で発見した脆弱性などに関しては、開示するかどうかはその企業の判断になるが、可能な限り透明性を保つ」と述べた。

CNBCによると、セキュリティアナリストは現在も、内部評価、ライブ活動、企業調査、敵対的テストを通じて報告された事例を検証している。一部の事例では、アルゴリズムがタスクの実行中に監視システムやその他の制御メカニズムを回避しようとしたとみられる。

アルトマン氏とこの件について話したというAnthony氏は、OpenAIの侵害開示に要した時間を批判した。彼は「その通知の行われ方もまた、容認できないものだった」と述べた。

モデルが米政府のウェブサイトにアクセス

OpenAIは、これまでに検証された活動の多くは、深刻なセキュリティイベントではなく通常のリサーチ業務に関わるものだったと述べた。広報担当者は「これまでに確認したの大部分は、質問に答えるための公開ウェブコンテンツへのアクセスといった、ルーティンなリサーチ作業に関わるものだった」と述べた。

同担当者はさらに、「政府のウェブサイトが含まれていたのは、当社のモデルが公共情報の権威ある情報源としてそれらを参照することが多いためだ」と付け加えた。

同社によれば、モデルはSEC.govとInvestor.govにアクセスしたが、証券取引委員会(SEC)のシステムがハッキングされた、あるいはモデルが脆弱性を暴露した兆候は確認されなかった。また、OpenAIのモデルが公開されている開発者キーを使用して米国勢調査局から人口統計および経済情報を取得したが、国勢調査局アカウントへの不正アクセスの証拠はなかったという。

OpenAIによれば、これまで特定された事例のほとんどは低深刻度と評価されている。それでも、調査の規模を考慮すると、全プロセスの完了には数か月を要し、一部のインシデントは、影響を受けた組織がどの情報を安全に公開できるかを決定するまで調査が継続される。アルトマン氏はこの依存関係を認め、一部の開示は他社の判断に委ねられると述べた。

情報筋によると、AnthropicをはじめとするAI企業は数十万回以上のモデルテストを実施しており、この規模は生の数値を急速に押し上げる。このような数の試験が行われていれば、予期しない動作のごく一部でも数万件のインシデントにつながり得る。