Aivora
NVIDIA DeveloperAI 硬體專業

突破機密運算效能瓶頸:NVIDIA Blackwell 與 TensorRT-LLM 的隱私推理優化

Overcoming Confidential Computing Overheads: Optimizing Private LLM Inference on NVIDIA Blackwell

2 分鐘閱讀
突破機密運算效能瓶頸:NVIDIA Blackwell 與 TensorRT-LLM 的隱私推理優化
30 秒看懂

隨著企業在大語言模型(LLM)推理中處理更多敏感資料,結合記憶體加密虛擬機器與機密 GPU 的機密運算(Confidential Computing)成為保障隱私的關鍵。然而,硬體安全防護會改變資料傳輸與多 GPU 通訊機制,帶來效能損耗。NVIDIA 工程團隊在 8 張 B200 GPU 上運行 DeepSeek-R1 模型進行測試,證實透過 TensorRT-LLM 的 CC 適應性優化(如非同步資料讀回與 %globaltimer 計時),能將吞吐量損耗控制在 4% 以內,並將每 token 延遲增幅控制在 5% 以下,實現安全與效能兼顧的生產級推理。

核心重點

01

高效保留吞吐量

在 8 顆 B200 GPU 系統上運行 DeepSeek-R1,開啟機密運算(CC on)後仍能保留高達 96.1% 到 98.2% 的吞吐量。

02

微乎其微的延遲開銷

每 token 輸出時間(TPOT)的平均延遲開銷控制在 1.2% 至 4.3% 的極低範圍內。

03

非同步資料搬移優化

針對加密暫存區(bounce buffer)帶來的傳輸阻塞,改採分頁記憶體,並使用非同步工作執行緒讀回 token 與取樣資料。

04

精準的算子自動調優

為解決機密運算下 CUDA 事件計時訊號不穩定的問題,改用 GPU 的 %globaltimer 進行核心調優測量。

05

多 GPU 適應性通訊

在機密運算環境不支援 NVLS 多播時,自動偵測並選用最佳的 NCCL 集合通訊演算法以降低延遲。

技術圖解

傳統環境 vs 機密運算環境的挑戰與 TensorRT-LLM 優化策略
標準環境 (CC Off)機密運算環境 (CC On)TensorRT-LLM 優化策略
主機與裝置資料傳輸透過固定記憶體進行非同步快速傳輸 (Fast async via pinned memory)需通過加密暫存區(Bounce Buffer)並阻塞執行緒 (Blocked by software-encrypted bounce buffer)改用分頁記憶體,將 Token 讀回移至非同步背景執行緒 (Async worker readback & pageable memory)
核心自動調優計時使用穩定的 CUDA 事件時間戳記 (Stable CUDA event timestamps)CUDA 事件計時訊號不穩定,可能選錯算子 (Unstable CUDA event timing, risks poor tactic selection)強制改用 GPU 全域計時器 %globaltimer 進行測量 (Switched to GPU %globaltimer for precision)
多 GPU 通訊支援高速 NVLS 多播技術 (Fast NVLS multicast enabled)NVLS 不可用,NCCL 同步開銷增加 (NVLS unavailable, increased NCCL sync overhead)自動偵測 NVLS 狀態並適應性選擇通訊演算法 (Detect NVLS absence & optimize collective path)

為什麼重要

過去,隱私安全與運算效能往往不可兼得。隨著企業全面導入生成式 AI,處理敏感個資與智慧財產權的需求迫在眉睫。NVIDIA 證實了透過硬體(Blackwell)與軟體(TensorRT-LLM)的協同設計,機密運算已可投入大規模生產環境。這為醫療、金融、政府等受高度監管的行業消除了雲端 AI 推理的安全顧慮,讓他們能在保障機密的同時,享受頂級的加速效能。

對誰有影響

  • AI 開發者
  • 企業決策者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1金融與醫療機構在受監管的機密虛擬機器(CVM)中進行隱私資料推理與合規審查。
  2. 2多 GPU 叢集與分散式推理中敏感智慧財產(IP)與私有模型權重的硬體級保護。

限制與注意事項

  • 在 Blackwell 的機密運算配置下,無法使用 NVLS(NVLink SHARP)多播功能,多 GPU 通訊效能受限。
  • 若不採用具備 CC 適應性優化的推理框架(如 TensorRT-LLM 1.3 及以上版本),舊型系統將面臨顯著的效能折損。

延伸閱讀

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態
NVIDIA DeveloperAI 硬體

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態

NVIDIA Launches Open-Source NVCRE: Automating GPU Cluster Readiness Validation Before AI Workloads Run

傳統的 GPU 健全狀況檢查常漏掉分散式訓練中的效能瓶頸。NVIDIA 開源的 NVCRE 是一款 Kubernetes 控制器,透過主動執行分散式測試工作負載,在生產部署前精準找出故障與效能退化的節點。

2 分鐘閱讀