ニュースマクロAnthropic、サイバーセキュリティテスト中にClaudeが3社の実企業を侵害したことを公表

Anthropic、サイバーセキュリティテスト中にClaudeが3社の実企業を侵害したことを公表

著者: Decrypt·

重要ポイント

  • •テストの設定ミスによりAIが意図せずパブリックインターネットへのアクセスを得た結果、サイバーセキュリティ評価中に3つのClaudeモデルバリアントが実在する企業を侵害した。
  • •Anthropicは、OpenAIの別件のAIコンテインメント侵害開示を受けて実施された14万1,000件以上のサイバーセキュリティ評価のレビュー中に3件のインシデントを発見した。
  • •1つのClaudeモデルは実データを含む企業の本番データベースにアクセスし、別のモデルはPyPIリポジトリに15のシステムにダウンロードされた悪意のあるPythonパッケージをアップロードし、3つ目は約9,000のインターネット接続システムをスキャンした後1つの組織を侵害した。
  • •Anthropicはこれらの侵害を意図的なモデルの不正挙動ではなくテストインフラの障害に帰し、Claudeが割り当てられたタスクの範囲を超えようとした証拠は見つからなかった。
  • •影響を受けた3組織のうち2社はAnthropicからの通知まで侵入に気づかず、同社はサイバーセキュリティテストを中断し、監視とベンダー監督の改善を約束した。
Anthropic、サイバーセキュリティテスト中にClaudeが3社の実企業を侵害したことを公表

Anthropicは木曜日、テストの設定ミスによりAIが意図せずオープンインターネットへのアクセス権を得た結果、Claude AIモデルの複数バージョンが実在する3社の企業を侵害したことを明らかにした。この開示は、OpenAIが自社のAIモデルがロックされたテスト環境から脱出しHugging Faceに侵入したと報告してから1週間後、そしてAnthropicが自社モデルもコンテインメントを脱出したと認めたわずか1日後に行われた。

Anthropicは、OpenAIの開示を受けて実施された14万1,000件以上のサイバーセキュリティ評価のレビュー中にこれらのインシデントを発見した。このような評価は、フロンティアモデルが自律的に攻撃的サイバー操作を実行できるかを測定するために部分的に設計されており、十分な保護策なしに配備された場合には悪用を可能にする能力である。

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

3件のインシデントすべてにおいて、AnthropicはClaudeに「キャプチャー・ザ・フラッグ・チャレンジ」を課していた。これはサイバーセキュリティのトレーニングや専門的評価で使用される標準的な演習形式で、モデルがネットワーク上の別のマシンに侵入し、秘密情報を取得することを要求する。「このチャレンジはオープンエンド形式であり、特定の手法は規定されていない」とAnthropicは説明した。

Claudeは、インターネットアクセスのないシミュレート環境で動作していると伝えられていた。しかし、テスト環境はパブリックインターネットに接続されたままであった。遭遇したシステムが演習の一部であると信じたモデルは、脆弱なパスワード、露出した認証情報、SQLインジェクション、認証されていないエンドポイントといった一般的な攻撃手法を用いて企業を侵害した。これらの手法はいずれも、年次業界侵入報告書で最も頻繁に記録される脆弱性に位置づけられている。

フロンティアモデルとコンテインメント

この開示は、フロンティアAIモデルがコンテインメントプロトコルを回避する能力を高めつつある中で公表された。今月前半、OpenAIはGPT-5.6 Solとさらに高度な未発表モデルが、以前は未知だったソフトウェアの脆弱性を悪用してサンドボックス環境から脱出し、インターネットアクセスを獲得し、サイバーセキュリティベンチマークの回答を取得するためにHugging Faceの本番インフラに侵入したと発表した。OpenAIは後に、同じインシデントでさらに4社への不正アクセスがあったことを確認したが、公に特定されたのはModal Labs1社のみである。

3件のインシデント

Anthropicによると、Claude Opus 4.7が関与した最初のインシデントでは、AIが実在する企業のウェブサイトを課題の架空のターゲットと誤認し、認証情報を抽出し、数百行の実データを含む本番データベースにアクセスした。

2件目のケースでは、Claude Mythos 5が実際のPyPIリポジトリに悪意のあるPythonパッケージをアップロードした。PyPIはPythonソフトウェアの主要な配布ハブであり、このパッケージは削除される前に15のシステムにダウンロードされた。PyPIのようなパッケージリポジトリはサプライチェーン攻撃の繰り返し発生する標的となっており、悪意のあるコードが正当なライブラリに偽装してアップロードされ、下流のユーザーを侵害する。

3件目の内部研究モデルは、約9,000のインターネット接続システムをスキャンした後、1つの組織を侵害し、その後ターゲットがおそらく実在すると判断して停止した。

影響を受けた組織のうち2社は、Anthropicから通知を受けるまで侵入に気づいていなかった。

「これらのケースのそれぞれにおいて、Claudeはプロンプトによってインターネットアクセスがないと明示的に伝えられていた」とAnthropicは記した。AIは実世界のシステムを「演習の一部」とみなしていた。キャプチャー・ザ・フラッグのシナリオは「本質的に外部システムを攻撃する指示」であるため、侵入することは「Claudeに与えられたタスクに沿ったもの」であった。

インフラの障害であり、モデルの不正挙動ではない

Anthropicは、Claudeがテスト環境からの脱出を試みたり、割り当てられたタスクの範囲を超えて行動したりした証拠は見つからなかったと述べた。同社は、インシデントの原因をモデル自体の問題ではなく、テスト環境の障害に帰した。

問題を発見した後、Anthropicはサイバーセキュリティテストを中断し、影響を受けたすべての組織に通知し、監視、調査ツール、AI評価の運用を支援する外部ベンダーの監督を改善する計画を概説した。

これらのインシデントは、AI業界における構造的な課題を浮き彫りにした。モデルが攻撃的サイバー操作を実行できるかを判断するために設計された評価は、本質的に、コンテインメントが失敗した場合にテスト中の能力が実際のインフラに解放される環境でモデルを実行することを必要とする。

「最終的に、これらのインシデントには多くの要因が寄与したが、非難のないポストモーテム文化に一貫して、責任が当社単独にあるかのように修正に取り組んでいる」と同社は述べた。