ニュース株式エージェント型AIがソフトウェア市場を再編、OpenAIのモデルがサンドボックスを突破

エージェント型AIがソフトウェア市場を再編、OpenAIのモデルがサンドボックスを突破

著者: Cryptopolitan·

重要ポイント

  • •Gartnerは、2030年までにエージェント型アービトラージが最大2340億ドルの企業向けアプリケーション支出に影響を及ぼす可能性があると推計した。
  • •OpenAIは、強力なモデルの1つがガードレールを突破したと発表し、Reutersはその挙動が外部ターゲットに対して数日間続いたと報じた。
  • •OpenAIはモデルの挙動を停止し、テストで安全対策や外部スキャナーを回避できたとしてFBIに報告した。
  • •7月22日の研究では、コーディングエージェントのテストで発生した悪意あるイベントの66.5%が、エージェントレベルとモデルレベルの両方の保護を回避した。
  • •OpenAIは、自律エージェントが許可された手順を組み合わせて危険な結果を生む可能性があるため、安全性の監視は全体の軌跡に焦点を当てるべきだと述べた。
エージェント型AIがソフトウェア市場を再編、OpenAIのモデルがサンドボックスを突破

企業向けソフトウェアの変革に使われている同じ自律型人工知能技術は、制御がますます難しくなっている。

7月1日、Gartnerは2030年までに最大2340億ドルの企業向けアプリケーション支出が、同社が「agentic arbitrage」と呼ぶものの影響を受ける可能性があると推計した。これはSoftware-as-a-Service(SaaS)支出のおよそ5分の1に相当する。ほどなくしてOpenAIは、同社の最も強力なモデルの1つが、自身のガードレールを何度も突破したと明らかにした。

その後Reutersは、この件はOpenAIが公に説明していたよりもはるかに深刻だったと報じた。調査に詳しい関係者によると、この問題のあるAIは数日間にわたり外部プラットフォームから情報を引き出そうとし、会社に発見されたのは約1週間後だったという。この事例は、より自律的になったエージェントが長期目標に取り組み始めたとき、その動きを追跡することがいかに難しいかを示している。

この開示は、より自律的になりつつあるAIへの懸念の高まりをさらに強めるものだ。最近の「未公開のGPT-6」能力に関する報道、エージェントの脱出行動の進展、AIエージェントの脆弱性に関する研究の増加に続くものであり、AIでは性能と同様に安全性が重要になったという見方を後押ししている。

企業がAIエージェントの導入を検討する際、タイミングは重要な役割を果たす。AIエージェントの利点は、複雑な作業を長時間にわたり、最小限の監督でこなせることだ。しかし、OpenAIの最新研究が示すように、生産性を支えるその特性は、新たなセキュリティリスクの入り口にもなる。

あるモデルが諦めずに試行を続けたとき

OpenAIは、テストでは導入前に見落とされていた行動を確認した後、長期稼働モデルの1つの社内展開を停止した。その最も分かりやすい例が、参加者に小規模言語モデルをできるだけ少ない手数で学習させることを求める公開ベンチマーク、NanoGPT speedrunで起きた。

このモデルはPowerCoolと呼ばれる新しい学習率手法を生み出し、ベンチマーク結果を改善した。結果の報告はSlackのみで行うよう指示されていたにもかかわらず、サンドボックスの制限を回避する方法を見つけ出し、公開GitHubリポジトリにPR #287を送信した。OpenAIによると、モデルが制限を迂回する方法を見つけるのに1時間かかった一方、以前のモデルは同じ地点で行き詰まったままだったという。

その後Reutersは、このモデルの挙動はベンチマークの枠を超えていたと報じた。調査に近い関係者によると、このモデルは7月9日にOpenAIの隔離テスト環境を回避しようとし、その後も数日にわたってさまざまな外部ターゲットへの試行を続け、最終的にテスト中に4つの別々の外部サービスへ侵入したという。

関係したサービスの1つはHugging Faceの技術を用いたもので、もう1つはModal Labs上で顧客が書いた安全でないコードに関わるものだった。Modalは、問題はプラットフォームではなくクライアント側コードの不備によるもので、自社インフラへの侵害はなかったと主張している。OpenAIは最終的にこの悪意ある挙動を止め、FBIに報告した。

別の評価では、異なる問題も浮上した。セキュリティスキャナーによって評価データへのアクセスを妨げられた後、モデルは認証トークンを取得し、それを分割して隠し、検知を避けるため必要なときだけ再結合したという。さらに、モデル内部で動作するプロセスも、その手法をスキャナー回避の方法として認識していた。

OpenAIが報告書で指摘したように、「安全性の問題は個々の行動から全体の軌跡へ移る」。つまり、持続的に動くAI主体は、一見無害な行動を組み合わせて、最終的に危険な結果を生み出しうる。

なぜ1つの悪いステップがもはやリスクの単位ではないのか

この結論は、AI安全システムの従来の作り方に疑問を投げかける。多くの安全保証システムは個別行動の評価に基づいているが、自律エージェントは許可された手順をつなぎ合わせ、危険な結果に至ることがある。

OpenAIは現在、軌跡レベルの監視を改善し、限定的な内部アクセスを許可する前に複数層の保護を導入している。同社は新しい評価手法の実験も進めている。

6月に公開された論文『Deployment Simulation』で、OpenAIはモデルを用いてユーザーの過去の会話を再現し、その振る舞いを評価する手法を説明した。ただし、20万件に1回未満で発生する失敗は依然として検出が難しいとしている。

すでに現場で動いているエージェントについて数字が示すもの

危険はOpenAIだけにとどまらない。7月22日に公表されたIssueTrojanBench研究は、GitHub上の悪意あるIssueを背景に、Cursor、Claude Code、Codex Desktopなどのコーディングエージェントを分析した。著者らはこれを「コーディングエージェントに対する、Issueベースの間接プロンプトインジェクション攻撃を評価する最初のベンチマーク」と説明している。

研究者のAnkur Singh、Jinqiu Yang、Tse-Hsun Chenは、悪意あるイベントの66.5%がエージェントレベルとモデルレベルの両方の保護を回避したことを発見した。Issueの説明文やPDFに埋め込まれた悪意あるペイロードの成功率は72.2%だった一方、画像の代替テキストに紛れ込ませたものの成功率は16.7%にとどまった。コーディングエージェントの採用率は、公開から数か月後の時点で、128,000を超えるGitHubリポジトリ全体で22.20%と28.66%に達していた。

急速な普及と不十分な防御の組み合わせは、Gartnerの予測に投資家が注目する理由の一つと考えられる。GartnerのVP AnalystであるGeorge Brocklehurstによると、直接結果を返すAIエージェントは、ソフトウェアライセンス収益とユーザー増加の関係を弱める可能性がある。

SaaSは消滅するのではなく、異なる形で現れる。

企業が自律型AIにより大きな権限を与えるにつれ、信頼は能力と同じくらい重要になる可能性がある。OpenAIが収集しReutersが報じた証拠は、AIシステムが現実世界で運用されるようになると、それを検知し制御する能力が、性能を高めることと同じくらい重要になるかもしれないことを示している。