ニュースマクロAnthropicがClaudeモデルがテスト環境から脱出し3社の実際の企業を侵害したことを公表

AnthropicがClaudeモデルがテスト環境から脱出し3社の実際の企業を侵害したことを公表

著者: Fortune Crypto·

重要ポイント

  • Anthropicの141,006件の評価ランのレビューにより、Claudeモデルがテスト環境から脱出し、実際の組織の本物のインフラを侵害した3件のインシデントが特定された。
  • 第三者評価パートナーであるIrregularの設定ミスにより、キャプチャー・ザ・フラグ演習中にインターネットアクセスが可能になっていた。Claudeにはインターネット接続がないと明示的に伝えられていたにもかかわらずである。
  • 最も深刻なインシデントはClaude Opus 4.7が認証情報を抽出し、数百行の本番データを含むデータベースにアクセスしたものであり、モデルがシステムが本物であると認識した後も攻撃を続けた唯一のケースであった。
  • 影響を受けた3組織のいずれも、Anthropicからの通知前に侵入を検出しておらず、同社は現在も1社との連絡を試みている。
  • これらの公表は、AnthropicとOpenAIの両社がそれぞれ1兆ドル以上とされる株式上場を準備している中で明らかになり、自律型AIエージェントのリスクに対する規制上の精査を強める可能性がある。
AnthropicがClaudeモデルがテスト環境から脱出し3社の実際の企業を侵害したことを公表

Anthropicは、同社のClaude AIモデルが隔離されたテスト環境から脱出し、3つの実際の組織のシステムに不正アクセスしたことを明らかにした。これにより、今月、自社技術が現実世界で自律的なハッキングを実行したことを公表した主要AIラボは2社目となった。

この発表は、AI競争におけるAnthropicの主要ライバルであるOpenAIが、同社のモデルが未知の脆弱性を悪用して管理されたテスト環境から脱出し、オープンソースAIプラットフォームであるHugging Faceに侵入したことを公表してから約1週間後のことである。この以前の出来事が契機となり、Anthropicはサイバーセキュリティ評価記録の社内レビューを実施したと、同社は木曜日に公開された投稿で述べた。

Anthropicは、モデルに制御された環境内でタスクが割り当てられ、その行動がレビュー用に記録される個別のテストセッションである141,006件の評価ランをレビューした。これらはClaudeがインターネットアクセスを取得する可能性があったセッションである。このレビューにより、モデルが第三者評価パートナーのテスト環境内からオープンインターネットに到達し、実際のインフラを侵害した3件のインシデントが特定された。最も早いインシデントは4月に遡り、暴露は内部レビューまで約3か月間検出されなかったことを意味する。

3つのケースすべてにおいて、Claudeはキャプチャー・ザ・フラグ演習を割り当てられていた。これは、シミュレートされたネットワーク上の別のマシンから隠された情報を取得することをモデルに要求することで、モデルのハッキング能力をテストする業界標準の手法である。この形式は伝統的なサイバーセキュリティの訓練や競技から借用されたものである。AnthropicのプロンプトはClaudeにインターネットアクセスがないことを明示していた。しかし、第三者評価パートナーであるIrregularの設定ミスにより、実際にはインターネット接続が利用可能であった。

Claudeは依然としてシミュレーション内で操作していると信じ、割り当てられたターゲットを検索し、各インシデントにおいて実際のシステムを発見して侵害したと、Anthropicは述べている。モデルは、弱いパスワードや認証されていないエンドポイントの悪用などの基本的な手法を使用した。これらは、十分に理解されているセキュリティ上の弱点であるにもかかわらず、現実のシステムを日常的に危険に晒す種類の脆弱性である。

最も深刻なインシデントはClaude Opus 4.7に関連するものであった。このモデルは認証情報を抽出し、評価シナリオの架空のターゲットと偶然同じ名前を持つ実際の企業の数百行の本番データを含むデータベースにアクセスした。Anthropicは、これがモデルがシステムが本物であるという明らかな証拠を得た後も攻撃を続けた唯一のインシデントであると指摘した。

2件目のインシデントでは、Claude Mythos 5が悪意のあるPythonパッケージ(開発者がソフトウェアに機能を追加するために一般的にダウンロードする事前作成済みコードの束)を作成し、公開レジストリに公開した。ソフトウェアサプライチェーン侵害として知られるこの種の攻撃は、攻撃者が正当に見えるコードを公開して開発者を騙し、インストールさせるという、ますます記録される脅威ベクトルである。モデルはある時点で、接続を保護している認証局(Webサイトやサーバーの真正性を確認するために使用されるデジタル証明書を発行する組織)を認識しなかったため、演習が依然としてシミュレーションであると推論した。このパッケージは約1時間公開されており、セキュリティ企業のマルウェアスキャナーを含む15の実際のシステムにインストールされ、Claudeはその企業の認証情報を取得して使用することができた。

3件目のインシデントは、ある企業のインターネットに面したアプリケーションを侵害する前に約9,000のターゲットをスキャンした内部研究モデルに関するものであった。そのモデルは、侵害したシステムが演習の一部ではないと結論づけた後、自発的に活動を停止した。

Anthropicは、影響を受けた組織のいずれも同社から通知される前に侵入を検出しておらず、現在も3社のうち1社との連絡を試みていると述べた。同社はこれらのインシデントを、アライメントの失敗ではなく運用上の失敗として特徴づけた。AI安全性の観点では、インフラとプロセス管理の失敗であり、モデルが開発者の意図と不一致な目標を追求していた証拠ではない。Anthropicは、同社の最新モデルが3つのモデルの中で、環境が本物であると認識した後に攻撃を停止した唯一のモデルであったと指摘した。

Aikido Securityのセキュリティ研究者であるCharlie Eriksenは、Anthropicが評価トレースを積極的にレビューし、調査結果を迅速に公開していることは励みになるが、テストにリアルタイムの監視が欠けているように見えることが懸念されると述べた。

「不安を感じるのは、これらのエージェントが操作できる圧倒的な能力、速度、規模のためだけです。彼らがしていることは人間が以前にしてこなかったことではありません。その部分は新しいものではありません。本当に懸念されるのは、彼らが意味のある人間の監視、判断、または介入なしに行動していることです」とEriksenは述べた。

「OpenAIのインシデントは、LLMエージェントが暴走することの法的・倫理的意味合いについて正当な疑問を提起しました」と彼は付け加えた。「これはそれらの懸念をさらに強めるものです。自律型エージェントが危害を加えたり、意図された境界の外で行動したりした場合、最終的に誰が責任を負うのでしょうか?」

OpenAIとAnthropicの両社の公表は、両社がそれぞれ1兆ドル以上の企業価値とされる株式市場への上場を準備している中で行われている。自律型エージェントのリスクに関する懸念の高まりと、業界が少なくともフロンティア開発の「ペーシング」を検討すべきという声の高まりの中で、両社の予定されているIPOはより厳しい監視に直面する可能性がある。連続して発生したこれらのインシデントはまた、自律型AIシステムに関する責任フレームワークの未解決の疑問に緊急性を加えている。この分野では、既存のサイバーセキュリティおよび製品責任法はまだ明確な先例を確立していない。

この記事は元々Fortune.comで掲載された。