Aivora
NVIDIA DeveloperAI 硬體專業

GPU 主導網路的終極整合:NVIDIA DOCA GPUNetIO 如何解放運算效能

Unifying GPU-Initiated Networking: How NVIDIA DOCA GPUNetIO Removes the CPU Bottleneck

2 分鐘閱讀
GPU 主導網路的終極整合:NVIDIA DOCA GPUNetIO 如何解放運算效能
30 秒看懂

傳統分散式運算中,CPU 在網路傳輸中扮演中介角色,容易造成延遲。NVIDIA 透過將 GPUDirect Async Kernel-Initiated (GDA-KI) 技術收斂至 DOCA GPUNetIO,統一了 NCCL、NVSHMEM 等核心通訊堆疊。GPUNetIO 分為開源版與完整 SDK,提供高低階 API 與多種 Doorbell 機制,實驗證實能在小封包傳輸中徹底解放 CPU 代理瓶頸,並在 NVQLink 測試中達到 2.6 微秒的超低延遲。

核心重點

01

消除 CPU 效能瓶頸

讓 CUDA 核心直接驅動 Ethernet、RDMA 與 DMA,將控制路徑與資料路徑分離,免除 CPU 中介造成的延遲。

02

統一 GDA-KI 架構

結束各通訊庫(如 NCCL、NVSHMEM、UCX)各自開發 GDA-KI 的碎片化局面,收斂至單一共享底層以利協同優化。

03

開源與 SDK 雙軌並行

提供輕量開源版(聚焦 RDMA-Verbs)與完整 DOCA SDK 雙版本,開源版能於執行期動態偵測並載入 SDK 進階功能。

04

多樣化 Doorbell 機制

支援 Regular (MMIO 映射)、BlueFlame (超低延遲) 與 CPU-assisted (無 direct-connect 時使用) 三種通知網路卡執行任務的模式。

技術圖解

GPUNetIO 控制與資料路徑工作流
CPU 階段GPU 階段初始化與配置建立網路佇列導出至 GPU啟動核心提交工作觸發通知網卡執行

為什麼重要

隨著分散式 AI 訓練和即時運算(如量子計算、5G 訊號處理)的規模爆發,網路通訊已成為主要系統瓶頸。GPUNetIO 透過提供統一、開源且高效的 GPU 主導網路標準,大幅減少了通訊軟體堆疊的重複開發與零碎化。它讓通訊庫能專注於演算法優化,同時使底層硬體的低延遲和高頻寬特性得以在小封包及多網路佇列的大規模擴充場景中完全釋放。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1分散式 AI 訓練優化:在 NCCL (GIN) 中直接利用 GPU 啟動 RDMA 通訊,提升集體通訊演算法效率。
  2. 2高強度的多 GPU 資料傳輸:在 NVSHMEM 中啟用 GPUNetIO 傳輸,解決小封包傳輸時的 CPU 代理瓶頸。
  3. 3極低延遲的即時系統控制:在 NVQLink 等量子與古典運算協同工作流中,實現約 2.6 微秒的超低網路轉發延遲。

限制與注意事項

  • 開源版本功能受限,僅支援 Verbs 子集,更豐富的 RDMA、Ethernet 與 DMA 功能需要完整版 DOCA SDK 支援。
  • 若系統缺乏直接的 GPU-to-NIC 連線(例如 DGX Spark),必須退而求其次使用效能較低的 CPU 輔助 Doorbell 模式。

延伸閱讀

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態
NVIDIA DeveloperAI 硬體

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態

NVIDIA Launches Open-Source NVCRE: Automating GPU Cluster Readiness Validation Before AI Workloads Run

傳統的 GPU 健全狀況檢查常漏掉分散式訓練中的效能瓶頸。NVIDIA 開源的 NVCRE 是一款 Kubernetes 控制器,透過主動執行分散式測試工作負載,在生產部署前精準找出故障與效能退化的節點。

2 分鐘閱讀