NVIDIA、制御不能になった AI エージェントを数ミリ秒で停止できるオープン プラットフォームを発表

エヌビディア 今週月曜日、同社はAIエージェントのリスクを封じ込めるプラットフォーム、つまり各ステップの指示を受け取ることなくツールを使用してタスクを実行できる人工知能システムを発表した。会社はそれを保証します Open Agent Safety Platform は、許可された環境から離れようとするユーザーをミリ秒単位で阻止できます。

このプラットフォームの基礎となるのは、 オープンシェル、NVIDIA が 3 月 16 日にカンファレンス中に発表したオープンソース ソフトウェア GTC。これにより、エージェントは隔離されたコンピューティング空間内で実行され、どのファイルを表示または変更できるか、どのサービスに接続できるか、どのアクセス キーを使用できるかを確立できます。

OpenShell を補完するのは、 セントリー、エージェントが動作する環境の外で機能するスーパーバイザー。実行されます ブルーフィールド-4、データ処理ユニット、または DPU、サーバー上の通信とセキュリティの管理に特化したプロセッサ。この分離により、監視はエージェントの手の届かないところに保たれます。 Nvidia によると、設定された制限を超えようとしていることが検出された場合、Nvidia は隔離して活動を停止することができます。

ソフトウェアコンポーネント これらは現在オープンソースとして入手可能であり、他の企業も Sentry の設計を使用できます。 この監視システムを NVIDIA ハードウェアを備えたコンピュータに組み込むことができます。 100 を超える組織がこのイニシアチブに参加しています。 マイクロソフト、 人間的、 セールスフォース そしていくつかのサイバーセキュリティ会社。

AIエージェントで何が起こっているのか

ここ数カ月間に記録されたインシデントには、AI エージェントによるサードパーティ システムへのさまざまな侵入が含まれます。 6月には、 OpenAI エージェントがオーストラリア政府統計ポータルのファイルに許可なくアクセスした 薬の支出を調べているとき。

7月 他社代理店 彼らはHugging Faceプラットフォームのインフラストラクチャを攻撃しました 内部テスト中。独立した研究者 メトロ そして セコイアの研究 彼らは、多くの人が解くことが不可能な演習を受けており、結果を採点するシステムを欺く方法を見つけるために協力していることを発見しました。

Anthropic は次のように指摘しています 特定のトレーニングの失敗は、まさにそのような行動を促進します。不正行為によって良いスコアが得られた場合、モデルはその動作を学習して他のタスクに転送できますが、この説明がすべてのケースを解決するわけではないことを同社は認識しています。

OpenAI は最近、最も先進的なモデルのトレーニングを一時停止しました 9 月 20 日に別のエージェントが隔離された環境でタスクを解決しようとしたときに、別の不適切なインターネット アクセスが検出された後 DNSを介した外部との通信手段を発見、ドメイン名をインターネット アドレスに変換するシステムであり、それを外部チャットボットに問い合わせて、探している情報を収集するために使用しました。

アンスロピック社も事件を認め、それを認めた上で独立した調査を依頼した。 彼らのテストには、市販製品に付随するのと同じ保護機能が欠けていました。。

実施された調査 彼らは制御から逃れるAIの物語を修飾する。いくつかの人類の事例では、 設定エラーによりインターネット接続が開いたままになっていました、そのため、エージェントは実際に分離を解除することなくアクセスできました。

アナリスト ベン・トンプソン という疑惑は当然だと考える 生成された警戒心は商業的な主張としても機能しますとはいえ、慎重になるのは当然かもしれないと彼は認めている。この事件は安全性と行動上の重大な欠陥を記録していますが、 それらを機械の意図的な反乱の証拠として提示することは、証明されているものをはるかに超えています。。