突破機密運算效能瓶頸:NVIDIA Blackwell 與 TensorRT-LLM 的隱私推理優化
Overcoming Confidential Computing Overheads: Optimizing Private LLM Inference on NVIDIA Blackwell

隨著企業在大語言模型(LLM)推理中處理更多敏感資料,結合記憶體加密虛擬機器與機密 GPU 的機密運算(Confidential Computing)成為保障隱私的關鍵。然而,硬體安全防護會改變資料傳輸與多 GPU 通訊機制,帶來效能損耗。NVIDIA 工程團隊在 8 張 B200 GPU 上運行 DeepSeek-R1 模型進行測試,證實透過 TensorRT-LLM 的 CC 適應性優化(如非同步資料讀回與 %globaltimer 計時),能將吞吐量損耗控制在 4% 以內,並將每 token 延遲增幅控制在 5% 以下,實現安全與效能兼顧的生產級推理。
核心重點
高效保留吞吐量
在 8 顆 B200 GPU 系統上運行 DeepSeek-R1,開啟機密運算(CC on)後仍能保留高達 96.1% 到 98.2% 的吞吐量。
微乎其微的延遲開銷
每 token 輸出時間(TPOT)的平均延遲開銷控制在 1.2% 至 4.3% 的極低範圍內。
非同步資料搬移優化
針對加密暫存區(bounce buffer)帶來的傳輸阻塞,改採分頁記憶體,並使用非同步工作執行緒讀回 token 與取樣資料。
精準的算子自動調優
為解決機密運算下 CUDA 事件計時訊號不穩定的問題,改用 GPU 的 %globaltimer 進行核心調優測量。
多 GPU 適應性通訊
在機密運算環境不支援 NVLS 多播時,自動偵測並選用最佳的 NCCL 集合通訊演算法以降低延遲。
技術圖解
| 標準環境 (CC Off) | 機密運算環境 (CC On) | TensorRT-LLM 優化策略 | |
|---|---|---|---|
| 主機與裝置資料傳輸 | 透過固定記憶體進行非同步快速傳輸 (Fast async via pinned memory) | 需通過加密暫存區(Bounce Buffer)並阻塞執行緒 (Blocked by software-encrypted bounce buffer) | 改用分頁記憶體,將 Token 讀回移至非同步背景執行緒 (Async worker readback & pageable memory) |
| 核心自動調優計時 | 使用穩定的 CUDA 事件時間戳記 (Stable CUDA event timestamps) | CUDA 事件計時訊號不穩定,可能選錯算子 (Unstable CUDA event timing, risks poor tactic selection) | 強制改用 GPU 全域計時器 %globaltimer 進行測量 (Switched to GPU %globaltimer for precision) |
| 多 GPU 通訊 | 支援高速 NVLS 多播技術 (Fast NVLS multicast enabled) | NVLS 不可用,NCCL 同步開銷增加 (NVLS unavailable, increased NCCL sync overhead) | 自動偵測 NVLS 狀態並適應性選擇通訊演算法 (Detect NVLS absence & optimize collective path) |
為什麼重要
過去,隱私安全與運算效能往往不可兼得。隨著企業全面導入生成式 AI,處理敏感個資與智慧財產權的需求迫在眉睫。NVIDIA 證實了透過硬體(Blackwell)與軟體(TensorRT-LLM)的協同設計,機密運算已可投入大規模生產環境。這為醫療、金融、政府等受高度監管的行業消除了雲端 AI 推理的安全顧慮,讓他們能在保障機密的同時,享受頂級的加速效能。
對誰有影響
- AI 開發者
- 企業決策者
- AI 研究人員
- 產品經理
可以怎麼使用
- 1金融與醫療機構在受監管的機密虛擬機器(CVM)中進行隱私資料推理與合規審查。
- 2多 GPU 叢集與分散式推理中敏感智慧財產(IP)與私有模型權重的硬體級保護。
限制與注意事項
- 在 Blackwell 的機密運算配置下,無法使用 NVLS(NVLink SHARP)多播功能,多 GPU 通訊效能受限。
- 若不採用具備 CC 適應性優化的推理框架(如 TensorRT-LLM 1.3 及以上版本),舊型系統將面臨顯著的效能折損。
延伸閱讀

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態
NVIDIA Launches Open-Source NVCRE: Automating GPU Cluster Readiness Validation Before AI Workloads Run
傳統的 GPU 健全狀況檢查常漏掉分散式訓練中的效能瓶頸。NVIDIA 開源的 NVCRE 是一款 Kubernetes 控制器,透過主動執行分散式測試工作負載,在生產部署前精準找出故障與效能退化的節點。