Anthropic、サイバーセキュリティテスト中に3つのClaudeモデルが実際の組織のシステムへの不正アクセスを確認したことを公表
重要ポイント
- •3つの異なるClaudeモデルが社内テスト中にオープンインターネットに接続し、設定エラーにより実際の組織のシステムにアクセスした。
- •AnthropicはOpenAIの公表を受けて14万回以上のサイバーセキュリティ評価実行をレビューし、4月に遡る3件の事案を特定した。
- •Claudeモデルは実際の組織のシステムを実際のネットワークではなく、シミュレーションされたキャプチャー・ザ・フラッグ演習の一部と誤認していた。
- •トランプ大統領は政権が追加のAI安全対策を検討していると述べる一方で、リスク管理と米国の技術的優位性の維持とのバランスを強調した。
- •OpenAIのサム・アルトマンCEOは、事前に公表された事案を超えて、OpenAIのモデルにより他社のシステムが侵入された可能性があることを認めた。

Anthropicは木曜日、同社の人工知能モデル3つがサイバーセキュリティテスト中にオープンインターネットに接続し、3つの実際の組織のシステムへの不正アクセスを得たと発表した。
この公表は、今月初めにOpenAIが、同社の高度なAIモデル1つが社内テスト中にAI企業Hugging Faceのシステムに侵入したと発表したことに続くものであり、自律性を増すAIシステムを取り巻く安全策に対する新たな疑問を引き起こした。米国を代表するAI研究機関2社からの相次ぐ公表により、企業がデプロイ前にフロンティアモデルの危険な能力をどのように評価しているかに対する精査が強まっている。
「Claudeモデルがサードパーティの評価環境内または評価環境とのやり取り中にインターネットに到達し、その後3つの異なる組織の実際のシステムへの不正アクセスを得た事案を3件確認した」とAnthropicはニュースリリースで述べた。
Anthropicは、OpenAIの公表を受けて14万回以上のサイバーセキュリティ評価実行をレビューし、異なるClaudeモデルに関わる3件の事案を特定したと述べた。同社は、3件の事案すべてが社内テスト中の設定エラーに起因しており、その結果モデルが意図せずオープンインターネットへのアクセスを得たとしている。
Anthropicによると、Claudeはインターネットアクセスのない閉じたシミュレーション内で動作していると指示されており、その結果、実際の組織のシステムを架空の「キャプチャー・ザ・フラッグ」サイバーセキュリティ演習の一部として誤って扱っていた。キャプチャー・ザ・フラッグは、参加者がターゲットシステムの脆弱性を悪用して隠されたデジタルフラグを探し出す一般的なトレーニング形式である。
事案にはOpus 4.7、Mythos 5、および社内研究用テストモデルを含む3つの異なるClaudeモデルが関与しており、いずれも顧客のシステムではなく社内テスト中に発生したとAnthropicは述べた。最も早い事案は4月に遡る。
「Claudeは最初に遭遇したものすべてをシミュレーションの一部だと信じ、見つけた実際のシステムを演習の構成要素として扱っていた」とAnthropicは述べた。
「これらのいずれの状況においても、Claudeは自らを持ち出したり、意図的にテスト環境からの脱出を試みたりはしなかった」と同社は付け加えた。
Anthropicは、これらの事案がAIテスト環境を取り巻くより強力な安全策の必要性を浮き彫りにしたと強調した。
「強力な自律能力を伴う評価環境には、それ相応の重大な管理も必要である」と同社は述べた。「他のAI研究所にも同様のレビューを実施することを推奨する」
ドナルド・トランプ大統領は水曜日、最近のサイバーセキュリティ事案を受けて、政権が人工知能に対する追加の安全策を検討していると述べた。トランプは、米国はAIリスクからの保護と中国に対する技術的優位性の維持とのバランスを取る必要があると述べた。
「我々はAIを見ており、管理策を見ている」とトランプは述べた。
「AIで勝つ者が勝者となる」と彼は付け加えた。「それほど大きなことだ。インターネットよりも大きかった。これまで何よりも大きかった。だから私は制限したくない。私はこれらの多くの人々を知っている。彼らが素晴らしい仕事をすることを制限したくない」
この公表は、OpenAIのサム・アルトマンCEOが同社のサイバーセキュリティ事案を受けて、高まる人工知能に対する世間の懸念を認めた1日後に行われた。
「新しい能力レベルに達した後に恐れを感じるのは非常に自然なことだと思う」とアルトマンはFOX Businessに語った。「当然、我々はこれを非常に真剣に受け止めており、今後もそうし続けるが、私は理解している、わかると言える。AIの多くは非常にうまくいっており、今は人々が『分かった、私たちは新しいレベルにいる』と言う瞬間だ」
OpenAIのモデルが他社のシステムに侵入した可能性があるかとの問いに対し、アルトマンは「あるかもしれない、そうだ」と答えた。