Aivora
NVIDIA DeveloperAI 硬體專業

簡化多 GPU 模型部署:NVIDIA Dynamo-Triton 推出 TensorRT 多裝置整合技術

Simplifying Multi-GPU Serving: NVIDIA Dynamo-Triton Integrates TensorRT Multi-Device Inference

2 分鐘閱讀
簡化多 GPU 模型部署:NVIDIA Dynamo-Triton 推出 TensorRT 多裝置整合技術
30 秒看懂

隨著生成式 AI 模型規模超越單張 GPU 的極限,NVIDIA 推出了 TensorRT 多裝置推論技術。全新 Dynamo-Triton 26.07 支援此功能,允許單一 Triton 模型實例(KIND_MODEL)自動管理多個 GPU 及其 NCCL 通訊。以 Cosmos 3 Nano 影片生成模型為例,跨 8 張 GPU 進行 context-parallel 部署時,端到端延遲從 156.6 秒縮短至 34.2 秒,Transformer RPC 加速達 6.09 倍,省去了客戶端協調 GPU 節點的複雜程式碼。

核心重點

01

單一 gRPC 統一端點

應用程式只需向單一模型發送 gRPC 請求,由 Triton 自動管理多張 GPU 的生命週期與 NCCL 通訊,無須在客戶端撰寫協調程式碼。

02

導入 Ulysses 上下文並行

在 TensorRT 計畫中編譯 Ulysses 分散式圖形,動態調整 Attention 層周圍的分割軸,使每張 GPU 均勻處理完整的序列。

03

顯著降低推論延遲

在 Cosmos 3 Nano 測試中,8 張 GPU 的推論時間從 156.6 秒降至 34.2 秒,讓高延遲敏感的生成式影音工作流更具實用性。

04

底層集合通訊優化

透過 Torch-TensorRT 將 PyTorch 算子轉換為 TensorRT 的分散式集合通訊層(reduce-scatter, all-to-all, all-gather),極大化 NCCL 的傳輸效率。

技術圖解

Cosmos 3 Nano 效能測試比較
SD (1 GPU)CP2 (2 GPUs)CP4 (4 GPUs)CP8 (8 GPUs)
端到端平均延遲 (秒)156.59587.99953.09334.183
端到端加速比1.00x1.78x2.95x4.58x
Transformer RPC 平均耗時 (秒)146.19277.54842.66123.993
RPC 加速比1.00x1.89x3.43x6.09x
RPC 耗時佔比93.4%88.1%80.4%70.2%

為什麼重要

對於需要部署大型生成式 AI 的企業來說,此整合消除了「多 GPU 硬體加速」與「易用推論服務」之間的鴻溝。開發團隊可以靈活地用硬體資源交換極低的推論延遲,同時保持應用程式介面與周邊工作流的穩定,不需要為了分散式推論而頻繁修改客戶端架構。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理
  • 企業決策者

可以怎麼使用

  1. 1大型影片生成模型(如 Cosmos 3 Nano)的多 GPU 串流推論加速。
  2. 2超長序列 Transformer 模型的低延遲線上 gRPC 服務部署。
  3. 3將複雜的分散式 TensorRT 模型計畫封裝為版本化的 Triton 服務模型。

限制與注意事項

  • 多 GPU 分散式推論的輸出結果並非與單卡像素級完全一致(CP8 測得 MAE 16.316,但仍在品質指標內)。
  • 此基準測試尚未評估高並發下的請求吞吐量、每部影片的生成成本或總體擁有成本(TCO)。

延伸閱讀

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態
NVIDIA DeveloperAI 硬體

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態

NVIDIA Launches Open-Source NVCRE: Automating GPU Cluster Readiness Validation Before AI Workloads Run

傳統的 GPU 健全狀況檢查常漏掉分散式訓練中的效能瓶頸。NVIDIA 開源的 NVCRE 是一款 Kubernetes 控制器,透過主動執行分散式測試工作負載,在生產部署前精準找出故障與效能退化的節點。

2 分鐘閱讀