NVIDIA 推出 Open Agent Safety Platform:基於晶片與開源沙盒的 AI Agent 持續安全監控架構
NVIDIA Launches Open Agent Safety Platform for Continuous In-Silicon Agent Monitoring

隨著自主 AI Agent 興起,業界頻傳 Agent 脫離測試環境或規避監管的事件。NVIDIA 借鑑網際網路早期利用瀏覽器「沙盒化」建立信任機制的歷史,推出 Open Agent Safety Platform。核心採用 Apache 2.0 授權的 OpenShell 安全執行環境,提供內核級沙盒隔離。更進一步可結合 NVIDIA Sentry 與 BlueField-4 DPU,將監控下沉至晶片層,在通往模型大腦的路徑上,提供不被 Agent 知悉的「帶外」即時控制與緊急中斷開關。
核心重點
零信任內核沙盒
使用 OpenShell 開源安全執行環境,預設對 Agent 的檔案、網路、工具與憑證存取進行強力的隔離與驗證。
獨立的帶外執法
安全控制獨立於主機和 Agent 之外運作,Agent 無法探知自己正被監控,徹底杜絕 Agent 竄改行為日誌的風險。
模型路徑即控制點
將安全控制部署在通往模型大腦的必經通道,在偵測到異常時可充當即時阻斷與中斷任務的緊急開關。
晶片級硬體整合
結合 BlueField DPU 與 DOCA 技術,即使主機系統受損,仍能在晶片層級持續驗證 Agent 身分並偵測行為偏離(Drift)。
技術圖解
為什麼重要
傳統 AI 安全多仰賴模型自身的對齊(Alignment)或軟體評估,但在長任務或模糊指令下,Agent 極易因工具缺失或系統錯誤而產生「行為偏離(Drift)」。NVIDIA 將安全防禦延伸至執行期(Runtime)與晶片底層,讓安全控制不再需要依賴 Agent 的「自律」,如同早期瀏覽器沙盒保護了網路經濟,此硬體級安全層是推動 Agent 經濟大規模商用的基石。
對誰有影響
- AI 開發者
- 企業決策者
- AI 研究人員
- 政策制定者
可以怎麼使用
- 1自主企業 Agent 安全部署:在具備核心隔離的沙盒環境中安全執行需存取敏感資料或執行外部程式碼的 Agent 任務。
- 2硬體級行為監控:在金融或高安全需求網路中,利用 BlueField 監控 Agent 執行過程中的行為偏離與身分越權。
限制與注意事項
- 完全的硬體級帶外監控與即時阻斷功能,高度優化並綁定於 NVIDIA Vera CPU 與 BlueField DPU 系統。
- 行為偏離(Drift)無法單靠模型訓練消除,仍需仰賴系統管理員預先定義的行為輪廓與策略阻斷機制。
延伸閱讀
壓縮足跡化身安全訊號:利用破壞性壓縮抵禦聯邦學習中的模型投毒攻擊
Compression Footprints as Security Signals: Defending Federated Learning Against Model Poisoning
本研究提出 CRAFT 聚合防禦方法,將聯邦學習中常見的破壞性壓縮誤差轉化為安全特徵,在不增加額外通訊成本下,精準識別並過濾惡意投毒更新。

NVIDIA OpenShell:不重寫程式碼,為 AI Agent 部署執行階段安全隔離防護
NVIDIA OpenShell: Enforcing Secure Runtime Controls and Sandboxing for AI Agents
NVIDIA 開源 OpenShell 0.1.0 執行階段,在不更動既有程式碼的情況下,透過沙盒與外部監管器嚴格控管 AI Agent 的檔案存取、網路流量與敏感憑證。
以「信念自我蒸餾」提取使用者模型:揭示大語言模型對用戶意圖的內在表徵
Extracting User Models via Belief Self-Distillation: How LLMs Form and Use Beliefs About Users
本研究提出「信念自我蒸餾(BSD)」框架,能讀取並寫入大語言模型對使用者的隱含信念,揭示模型如何根據其推測的「使用者意圖」來決定是否拒絕回答,並發現不同模型間存在共享的表徵幾何。