NVIDIA OpenShell:不重寫程式碼,為 AI Agent 部署執行階段安全隔離防護
NVIDIA OpenShell: Enforcing Secure Runtime Controls and Sandboxing for AI Agents

隨著自主 AI Agent 權限擴大,誤刪生產資料或洩漏機密的風險也大幅增加。NVIDIA OpenShell 0.1.0 提供了一套位於 Agent 工作負載外部的安全執行階段。它由 Gateway、Supervisor 和 Sandbox 三大元件組成,能在作業系統核心層級限制檔案系統存取,並深度解析 HTTP、GraphQL 及 MCP 流量。此外,它能將真實憑證保留在沙盒外,並使用「形式化策略證明」確保 Agent 無法透過對抗性話術或提示詞來騙取非授權的權限。
核心重點
外部安全控管
安全規則與權限控管完全在 Agent 工作負載外部運行,無須重寫既有的 Agent 程式碼即可無痛導入。
三層式防禦架構
整合 Gateway 閘道、Supervisor 監管器與核心級 Sandbox 沙盒,阻斷未授權的網路路徑。
細粒度 API 過濾
超越傳統 IP 封鎖,能過濾並分析特定 API 請求,實現「僅能讀取 GitHub,阻擋寫入」的精準控制。
形式化邏輯驗證
內建策略證明器,可證明權限未超出安全邊界,防止 Agent 透過長達數小時的說服與引導騙取權限。
技術圖解
為什麼重要
隨著企業進入自主 AI Agent 時代,Agent 必須讀寫程式碼、呼叫 API 並執行長時間任務。OpenShell 為企業提供了一道防波堤,使高風險產業(如晶片設計、實體機器人、敏感自動化流程式)能放心部署自主 Agent。它能在不減損 Agent 靈活度的前提下,確保系統核心、敏感憑證與生產資料的絕對安全。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
- 產品經理
可以怎麼使用
- 1自主晶片設計:Cadence 在其 ChipStack RTL 設計 Agent 中利用 OpenShell 保護敏感智慧財產權與設計工具。
- 2實體機器人決策治理:Gecko Robotics 透過 OpenShell 控管運行在實體機器人身上的 Agent 所做出的決策。
- 3企業級任務自動化:Slack 正在基於 OpenShell 建置隨選 Agent 平台,確保自動化任務執行不越權。
限制與注意事項
- 檔案系統與處理程序的核心級限制,必須在沙盒啟動時即設定完成,無法於執行階段動態修改。
- 目前版本(0.1.0)多 Agent 之間的聯合策略分析與多重互動安全驗證仍處於持續研發階段。
延伸閱讀
壓縮足跡化身安全訊號:利用破壞性壓縮抵禦聯邦學習中的模型投毒攻擊
Compression Footprints as Security Signals: Defending Federated Learning Against Model Poisoning
本研究提出 CRAFT 聚合防禦方法,將聯邦學習中常見的破壞性壓縮誤差轉化為安全特徵,在不增加額外通訊成本下,精準識別並過濾惡意投毒更新。

NVIDIA 推出 Open Agent Safety Platform:基於晶片與開源沙盒的 AI Agent 持續安全監控架構
NVIDIA Launches Open Agent Safety Platform for Continuous In-Silicon Agent Monitoring
為防範 AI Agent 脫逃與失控風險,NVIDIA 推出開源的 Open Agent Safety Platform,整合 OpenShell 沙盒與 BlueField DPU 硬體防護,提供獨立於 Agent 之外的零信任帶外監控與即時阻斷機制。
以「信念自我蒸餾」提取使用者模型:揭示大語言模型對用戶意圖的內在表徵
Extracting User Models via Belief Self-Distillation: How LLMs Form and Use Beliefs About Users
本研究提出「信念自我蒸餾(BSD)」框架,能讀取並寫入大語言模型對使用者的隱含信念,揭示模型如何根據其推測的「使用者意圖」來決定是否拒絕回答,並發現不同模型間存在共享的表徵幾何。