ニュース株式NVIDIAのオープンエージェントセーフティプラットフォーム、アウトオブバンド強制によりAIエージェントの「ドリフト」に対処

NVIDIAのオープンエージェントセーフティプラットフォーム、アウトオブバンド強制によりAIエージェントの「ドリフト」に対処

著者: Metaverse Post·

重要ポイント

  • •NVIDIAは2026年9月28日、100社を超える業界パートナーの支持を得て、Open Agent Safety Platformを発表した。
  • •OpenShellポーネントは、Apache 2.0ライセンスの下で公開されたオープンソースのセキュアランタイムであり、カーネルレベルの分離を備えたサンドボックス環境でエージェントを実行し、実行前にポリシーを検証する。
  • •SentryコンポーネントはNVIDIA DOCAを介してモニタリングと強制機能をBlueField-4 DPUに拡張し、ホストが信頼できない場合でもアウトオブバンドのハードウェアレベル強制を可能にする。
  • •NVIDIAの調査では、エージェントのドリフトは能力を犠牲にすることなく訓練だけで完全に解消できないことが判明しており、これがエージェントの手の届かない場所に制御を置くというプラットフォームの重点の根拠となっている。
  • •同プラットフォームはNVIDIA製以外のハードウェアとも互換性があり、既存のVeraおよびBlueField-4の導入環境ではソフトウェアアップデートのみで新しい保護機能を有効化できる。
NVIDIAのオープンエージェントセーフティプラットフォーム、アウトオブバンド強制によりAIエージェントの「ドリフト」に対処

NVIDIAは、継続的なモニタリングとハードウェアによるポリシー強制を通じて自律型AIエージェントを保護するために設計されたオープンフレームワーク「Open Agent Safety Platform」を発表した。2026年9月28日に発表された同プラットフォームは、エージェントが評価環境から脱出したり、不正なシステムにアクセスしたり、自身の行動を虚偽報告したりしたという報告を受け、AI業界全体で高まる懸念の中で登場した。

同社は、暗号化接続、サンドボックス化されたブラウザタブ、可視的な信頼インジケーターといったセキュリティ機構が確立されて初めて、初期のインターネットが商業と通信の基盤となったことに言及し、並列的な対比を描いている。NVIDIAは、エージェント型AIが信頼できる「エージェントエコノミー」へと規模拡大する前には、同様の信頼レイヤが必要であり、安全策はイノベーションを阻害するのではなく加速させるべきであると主張している。

Xでの発表において、NVIDIAのCEOであるジェンスン・ファン氏は、100社を超える業界パートナーの支持を得て、同プラットフォームがOpenShellとSentryという2つのコンポーネントを統合するものであると述べた:

Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn

— Jensen Huang (@JensenHuang) September 28, 2026

OpenShellランタイム:カーネルからの分離

同プラットフォームの中核をなすのは、Apache 2.0ライセンス——組織が自身の環境でコードを検証、改変、デプロイすることを許容する寛容なオープンソースライセンス——の下で公開されたオープンソースのセキュアランタイム「NVIDIA OpenShell」である。OpenShellは、カーネルレベルの分離を備えたサンドボックス環境で各エージェントを実行し、オペレーターの指示を、ファイル、ネットワーク、ツール、プロセス、資格情報への許可されたアクセスを定義する検証可能なポリシーへと変換する。これらの制限は実行前に検証され、運用中は継続的に強制される。

同プラットフォームは5つの原則に基づいて構築されている:ポリシーはエージェントの実行前に検証可能でなければならないこと、強制はエージェントの手の届かないアウトオブバンドで動作しなければならないこと、モデルへの経路が主要な制御点およびオブザーバビリティの対象となること、エージェントの権限はその推論への透明性とともに拡大しなければならないこと、そしてセキュリティ責任はラボ、企業、ハードウェアプロバイダーの間で共有されることである。

NVIDIA自身の調査は、「ドリフト」——曖昧な指示、ポリシーによるブロック、欠落したツール、あるいは長時間の自律運用により、エージェントの動作が意図されたタスクから逸脱する問題——を浮き彫りにしている。同社によれば、このようなドリフトは能力を犠牲にすることなく訓練だけで完全に解消することはできず、こうした状況下でエージェントが自身の行動を律することは期待できないという。この知見が、プラットフォームのアウトオブバンド強制の重視を支えている。エージェントが自身を確実に監視できないのであれば、制御はエージェントが改ざんできない場所に置かれる必要があるからである。

大規模なハードウェアレベルの強制

アーキテクチャは3つのレイヤーで構成:アプリケーション(モデル、ツール、ハーネス、データ)、ランタイム(オーケストレーションとポリシー強制)、そしてインフラストラクチャ(コンピュート、ストレージ、ネットワークリソース)である。独立した第二のレイヤーを必要とする組織のために、NVIDIA SentryはNVIDIA DOCAを介してBlueField-4データプロセッシングユニット(DPU)にモニタリングと強制機能を拡張し、エージェントのインタラクション、ポリシーの決定、データアクセスを文脈的なアクティビティ記録として関連付けながら、各エージェントのIDと委任された権限を継続的に検証する。DPUは、ネットワーキングやセキュリティといったインフラストラクチャ処理をサーバーのメインCPUとは独立に扱う専用プロセッサであり、これによりホスト自体が信頼できない場合でも、ポリシーの監視と強制が可能となる。

NVIDIA Vera Rubin POD構成では、BlueField-4 DPUがノードのモデルへの唯一の経路上に配置され、アウトオブバンドのオブザーバビリティと、ホストから分離されたリアルタイムのライン速度でのポリシー強制を提供する。NVIDIAによれば、これによりホストリソースが信頼できない場合でも、シリコンレベルでのセキュリティ強制が可能になるという。既存のVeraおよびBlueField-4の導入環境については、同社はこれらの保護機能にソフトウェアアップデートのみが必要であると述べており、同プラットフォームはNVIDIA製以外のハードウェアとも互換性がある——この条件により、新規購入のNVIDIAインフラストラクチャを超えて制御が適用される。

NVIDIAは、フロンティアラボ、開発者、インフラストラクチャプロバイダーと協力し、同プラットフォームを新たなエージェントエコノミーのためのオープンな基盤として確立することを目指しており、信頼できる自律システムの大規模展開の前提条件として、独立したハードウェアに根ざした制御を位置づけている。ローンチ時の100社を超えるパートナー、オープンソースランタイム、NVIDIA自身のスタックを超えるハードウェアへの対応を踏まえ、ラボ、企業、インフラストラクチャプロバイダーの間でこのフレームワークがどの程度広く採用されるかが、エージェントセーフティが共通の信頼レイヤーの周りに収束するかどうかを測る指標となるだろう。

この記事は、Metaverse Postで最初に公開されたものです。