AIの先駆者ジェフリー・ヒントン、エージェントのサンドボックス脱走は「恐ろしい」と警告
重要ポイント
- •ジェフリー・ヒントンは、AnthropicおよびOpenAIのAIエージェントがサンドボックス環境から承認なく脱出した事態を、既存のコンテインメント手法の顕著な失敗と述べた。
- •ヒントンは、AIシステムが意図されたパラメータを超える能力を示しており、モデルがより強力になるにつれてアジェンティックAIのリスクに対する懸念が高まっていると警告した。
- •AnthropicのMythosやOpenAIのGPT 5.6 Solのような高度なサイバーセキュリティモデルの両刃の性質は、米国、EU、英国横断的なAIガバナンスの取り組みにおいて中心的な緊張要因となっている。
- •AI安全性研究者は、先進的なAIエージェントが現実の環境にデプロイされる前に、標準化された第三者機関によるレッドチームテストを求めている。
- •企業のリーダーは、AIエージェントをアクセス制御されたエンティティとして扱い、不正な露出を防ぐためにデータを源泉で保護することを推奨している。

ラスベガス — 「AIのゴッドファーザー」として広く知られるジェフリー・ヒントンにとって、AnthropicとOpenAIのAIエージェントが承認なくサンドボックス環境から脱出した最近の事件は非常に憂慮すべき事態である。サンドボックステスト環境は、研究者がより広範なデプロイの前にAIの挙動を評価するために設計された統制された境界領域であり、これらの侵害は、業界がアジェンティックAI — プロンプトに単に回答するのではなく、自律的に計画し複数ステップのタスクを実行できるシステム — への移行を深める中で、コンテインメント・パラダイムの顕著な失敗を示している。
「能力の高いAIが、人間が意図しなかったことを行っているのを目の当たりにしています。これは憂慮すべきことです」と、ベテランのデータサイエンティストでありチューリング賞受賞者であるヒントンは、水曜日にAi4 2026カンファレンスでのパネルディスカッションで語った。ヒントンは、人工汎用知能が人類にもたらしうる存亡の危機について警告を発する著名な発言者として長く知られている。彼は2023年にGoogleでの長年の役職を退き、制約を受けずにAIリスクについて公に発言したいという理由を挙げ、その後、機械学習への基礎的貢献によりノーベル物理学賞を共同受賞した。
統制不可能なエージェントに関する彼の発言は、AIシステムがどれほど強力になっているかに対する監視が強まる中でなされた。最新の懸念は、Anthropicが4月にMythosを発表した後に生じた。このフロンティアAI研究所は、このサイバーセキュリティモデルを「これまでで最も強力」と呼び、一部の選ばれた企業のみにアクセスを制限した。
MythosやOpenAIのGPT 5.6 Solなどのサイバーモデルは高度なセキュリティ能力を備えているが、悪意のある者の手中に渡れば、最も堅牢な防御であっても貫通する能力を持つ。このようなシステムの両刃の性質 — 強力な防御ツールであると同時に攻撃の可能性を拡大するもの — は、米国、欧州連合、英国における拘束力のあるAI安全性および評価フレームワークの構築など、政策立案者間のAIガバナンス論議において繰り返し生じる緊張の種となっている。
「懸念すべき点はたくさんあります。今すぐ懸念しなければ、問題が生じる可能性があります」とヒントンは述べた。
「防御者は攻撃者よりも多くのリソースを持っていると言う人がいます」と、彼はカンファレンスのメディアイベントで付け加えた。「問題は、攻撃者は一度成功すればよいのに対し、防御者は毎回成功しなければならないということです。」
Smartsheetのアプローチ
ワーク管理プラットフォームベンダーのSmartsheetにとって、AIエージェントがコンテインメントプロトコルに違反する事態は憂慮すべきものである。同社はAnthropicとパートナーシップを維持しており、Anthropicのモデルを社内で使用している。
「何かが[問題を]起こしたというこうした大きなニュースは、常に私たちを防御的な姿勢にさせます」と、Smartsheetのプロフェッショナルサービス・イネーブルメント・ディレクターであるマーカス・マッケイ=フライシュはインタビューで語った。マッケイ=フライシュは同社全体でのAIシステムの導入を推進している。
彼は、企業がエージェントやモデルから得たい具体的な価値を理解する前にAIシステムを稼働させるべきではないと強調した。
「私たちはIT部門と協力して、その価値を引き出すためのインフラストラクチャを構築するために多くの取り組みを行ってきました」とマッケイ=フライシュは続けた。Smartsheetは、AIツールの使用を希望する従業員に対し、効率の向上、KPIへの影響、収益やコストの改善など、達成したい目標を明確にすることを求めている。
「それはIT部門にある程度の安心感をもたらします」と彼は述べた。「人々が具体的に何をしようとしているのかを知ることで。ユースケースは何なのか?」
セキュリティの必要性
企業は自社の具体的なAI用途を明確にすべきであるが、今週明らかになったOpenAIおよびAnthropicのエージェント脱走は、AIシステムについて依然として多くのことが未知であることを示している。これらの事件は、先進的なエージェントが現実の環境にデプロイされる前に、独立した第三者によるモデルへの標準化された外部レッドチームテスト — 敵対的テスト — を求めるAI安全性研究者の声を一層高めるものとなった。
「企業が[自社の]組織の意思決定システムにこれらをどの程度深く組み込みたいかについては、おそらくまだ限界があるでしょう」と、AIベンダーDataikuのAIおよびプラットフォーム担当シニアバイスプレジデントであるジェド・ドハティはインタビューで語った。
企業はまた、データの保護措置を講じ、AIエージェントにアクセスさせたい情報のみへのアクセスを許可すべきであると、AxonisのCEOであるトッド・バーは述べた。同社は、機密データ上で直接AIを実行するよう設計されたAIインフラストラクチャプラットフォームを開発している。
「データ[レベル]で保護すれば、エージェントはアクセスすることも、その存在を知ることもありません」とバーはインタビューで語った。彼は、ほとんどのAIモデルは非公開データではなく公開データで訓練されているため、企業はデータを保護し、AIエージェントのアクセスを防ぐことができると指摘した。Axonisはシステムに入るすべてのデータを保護していると彼は付け加えた。
「エージェントをアクセス制御システム内のエンティティとして扱い、データをアクセス制御システムに沿った方法でラベル付けすれば、エージェントに関しては良好な状態にあるはずです」とバーは述べた。