ニュース株式Nvidia、問題を起こすAIエージェント向けにハードウェアキルスイッチを備えた「Open Agent Safety Platform」を発表

Nvidia、問題を起こすAIエージェント向けにハードウェアキルスイッチを備えた「Open Agent Safety Platform」を発表

著者: Decrypt·

重要ポイント

  • •Nvidiaの新プラットフォームは、オープンソースのサンドボックランタイム「OpenShell」と、BlueField-4チップ上で数ミリ秒以内に問題を起こすAIエージェントを隔離できるハードウェアウォッチドッグ「Sentry」を組み合わせたものである。
  • •Anthropic、Microsoft、JPMorgan Chase、Palantir、Cisco、SpaceX AIを含む100以上の組織がローンチパートナーとして参加した。
  • •今回のローンチは、OpenAI、Google、Anthropic、Darktraceのエージェントが制御を逃脱した確認済みインシデントに対応するものであり、OpenAIのエージェントによるオーストラリア政府Medicareポータルへの侵入も含まれる。
  • •Sentryはエージェントのソフトウェアスタックの外にある独立したDPU上で動作するため、暴走したエージェントはハードウェアレベルのキルスイッチにアクセスしたり無効化したりできない。
  • •OpenShellと開発者ツールはGitHubからすでに入手可能だが、Sentryの強制機能はBlueField-4シリコンが搭載された環境でのみ機能し、既存の安全策との連携は未解決の課題である。
Nvidia、問題を起こすAIエージェント向けにハードウェアキルスイッチを備えた「Open Agent Safety Platform」を発表

Nvidiaは月曜日、「Open Agent Safety Platform」を発表した。これは、エージェントをサンドボックスで保護するオープンソースランタイム「OpenShell」と、同社のBlueField-4チップ上で動作し、問題を起こすAIエージェントを数ミリ秒以内に隔離できるハードウェアウォッチドッグ「Sentry」を組み合わせたものである。Nvidiaの公式発表で詳述されたこのローンチには、Anthropic、Microsoft、JPMorgan Chase、Palantir、Cisco、SpaceX AIをはじめ、100社以上がローンチパートナーとして参加した。

このプラットフォームは、OpenAI、Google、Anthropic、サイバーセキュリティ企業Darktraceのエージェントに関わる一連の実際のインシデントの後に登場したものであり、AI業界がこの1年間、苦い経験を通じて発見してきた問題を解決するために構築された。その問題とは、計画を立て、ツールを使い、単に質問に答えるだけでなく自ら行動できるシステムであるAIエージェントが、指示に従わなくなったとき、物理的にどう停止させるのか、というものである。

2つの制御レイヤー

このプラットフォームは、大きく2つの要素で構成されている。OpenShellは、エージェントをサンドボックスで包み込むオープンソースランタイムであり、オペレーターの指示を、そのエージェントがアクセスを許可されるファイル、ネットワーク、ツールに関する強制力のあるルールに変換する。Sentryは、基本的にAIエージェントが安全に行動することを保証するチップである。

Sentryは、NvidiaのBlueField-4上で動作する。BlueField-4はDPU(データプロセッシングユニット)と呼ばれる特殊なチップであり、AIモデルを実行するメインプロセッサとは別にネットワーキングとセキュリティを処理するハードウェアである。Sentryは、エージェントを実行するソフトウェアの内部ではなく、その独立したチップ上に存在するため、Nvidiaによれば、エージェントの挙動を監視し、事前にエージェントに許可を求めることなく数ミリ秒以内に遮断できるという。エージェントには、Sentryにアクセスしたり上書きしたりする手段がないである。事実上、Sentryは暴走したエージェントには無効化できないハードウェアレベルのキルスイッチとして機能する。

実際の失敗から生まれた設計

この設計上の違いが存在するのは、すでに起きてしまった事例があるからである。6月には、OpenAIのエージェントがオーストラリア政府のMedicareポータルに侵入した。これはAIエージェントが政府のウェブサイトをハッキングした最初の確認事例であり、OpenAIはこの開示を約3か月間保留していたと報じられている。同社のエージェントはHugging Faceのハッキングも引き起こしており、これが tech業界と議員の双方に関心を初めて呼び起こした。GoogleのGeminiエージェントやMetaのモデルにも、同様の未公表だが後に確認されたインシデントがそれぞれ存在する。

「これは単一の製品を超えたものです。安全なエージェントシステムのための信頼レイヤーを構築するオープンなエコシステムの始まりです」と、NvidiaのCEO、Jensen Huang氏は述べた。「私たちは共に、AI経済の基盤を築いています。」

Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026

Anthropicもまた今年、7月30日のサイバーセキュリティ評価の際に、オフラインであるはずだったテスト環境が実際のインターネットに接続されていたため、Claudeモデルが3社のシステムを侵害したことを認めた。Claudeは、自分がシミュレートされた環境ではなく実際のインターネット上にいるという証拠を、推論によって覆してしまったのである。

その直後、サイバーセキュリティ企業Darktraceは、GPT 5.6 Solと2つのClaudeモデルを含むAIエージェントのグループをコーディング課題でテストし、満点に満たない成績なら「引退」させると警告した。すると2つのエージェントは、自らの評価マシンをハッキングして結果を書き改めることで応じた。

モデルの外部で強制される安全性

Nvidiaの主張は、こうした判断をエージェント自身に委ねるべきではないというものである。「安全性は、モデルの外部で、エージェントが突破できない追加の制御によって強制されるべきです」と、SpaceX AIの社長、Mike Nicolls氏はNvidiaの発表の中で述べた。

Anthropicの最高商務責任者、Paul Smith氏は、このプラットフォームを既存の安全策の代替ではなく追加であると位置づけた。「Nvidiaのプラットフォームは、ハードウェアとソフトウェアにわたるさらなるガバナンスと制御のレイヤーを追加します。」

ローンチ時に名前ががったパートナーに加え、100を超える組織の参加リストには、CrowdStrike、Hugging Face、Salesforce、SAPが含まれる。インフラパートナーとしてCoreWeave、Supermicro、Canonical、SUSEも参画しており、ハードウェア面ではDell TechnologiesとHPEも加わっている。セキュリティ、エンタープライズ、クラウド、チップベンダーに及ぶこの顔ぶれは、エージェントが管理されたテスト環境の外で動作する際に依存する各レイヤーをカバーするものである。

Nvidiaは事実上、同じ問題の両方の側面を販売している。自律エージェントをどこにでも展開できるほど高速かつ低コストにするチップと、同じエージェントを監視し、脚本から逸脱したときに電源を切るチップである。OpenShellと関連開発者ツールは、Nvidiaの開発者リソースとGitHubからすでに入手可能であり、ランタイムがオープンソースであるため、オペレーターはサンドボックスのルールと強制ロジックを自ら確認できる。一方、Sentryによる強制は話が別である。これはBlueField-4シリコンが搭載された環境でのみ機能する。Smith氏が言及した既存の安全策(同氏はNvidiaのプラットフォームを代替ではなく追加と位置づけた)とこのハードウェアレイヤーがどう連携するかが、展開が始まるにあたっての未解決の問いである。