Aivora
NVIDIA DeveloperAI 硬體進階

破解電力瓶頸:NVIDIA DSX MaxLPS 如何釋放 AI 工廠高達 40% 的隱形算力

Unlocking Stranded Capacity: How NVIDIA DSX MaxLPS Boosts AI Factory Throughput by 49%

2 分鐘閱讀
破解電力瓶頸:NVIDIA DSX MaxLPS 如何釋放 AI 工廠高達 40% 的隱形算力
30 秒看懂

傳統 AI 工廠常以 GPU 最高峰值電力進行保守規劃,導致平時大量電力預算閒置。NVIDIA 推出的 DSX MaxLPS 技術,透過即時監測與策略性電力分配,打破靜態限制。在冰島 Nscale 資料中心以 Blackwell 架構的 GB300 NVL72 系統運行 Kimi K2.5 模型進行的實測中,DSX MaxLPS 在不改變 264.4 kW 電力預算的前提下,成功將管理 GPU 從 140 顆提升至 192 顆,使總吞吐量暴增 49.2%,且未影響個別任務的常態表現。

核心重點

01

動態電力調配

透過即時監控 GPU、節點和機架的功耗,動態分配閒置電力,取代保守的靜態峰值預留。

02

吞吐量顯著提升

在不增加核定總電力預算的前提下,將總吞吐量與每瓦效能提升 49.2%。

03

核心效能保持穩定

各實例(Instance)的中位數與 P75 延遲變化在 5% 以內,確保常態服務品質。

04

漸進式導入與驗證

提供明確的驗證流程,從定義邊界、建立基準到逐步增加容量,確保系統容錯與穩定性。

技術圖解

靜態配電基準與 DSX MaxLPS 效能實測對比
Static baseline (靜態基準)DSX MaxLPS (動態調配)
管理 GPU 數量140192 (+37.1%)
總吞吐量 (tokens/s)1,084,5031,618,443 (+49.2%)
每瓦特吞吐量4.10 tokens/s/W6.12 tokens/s/W (+49.2%)
電力預算利用率62.9%75.2% (+12.3 pp)
實測總功耗 (kW)166.2 kW198.9 kW (+19.7%)

為什麼重要

隨著 AI 模型規模與算力需求暴增,電力已成為資料中心建設的最大瓶頸。DSX MaxLPS 證明了硬體與軟體協同設計的力量,不需等待新建電廠或升級電網,就能直接在現有電力限制下部署多達 40% 的 GPU。這對面臨供電限制的雲端服務商與大型企業而言,能立竿見影地降低每 token 的基礎設施成本,最大化 AI 投資報酬率。

對誰有影響

  • 企業決策者
  • AI 開發者
  • 新創創辦人

可以怎麼使用

  1. 1面臨電力供應上限的 AI 算力工廠優化
  2. 2混合運行預訓練(Training)與推理(Inference)的異質工作負載機群管理
  3. 3綠色資料中心的高能效 LLM 大規模部署

限制與注意事項

  • P99 尾端延遲(Time to First Token)增加了 17%,在高即時性要求的場景需特別評估。
  • 高度依賴精準且無延遲的遙測(Telemetry)數據,若數據遺失或遲滯可能影響電力分配決策。
  • 雖然調配了閒置電力,但平均功耗依然上升(實測增加約 19.7%),實體配電與散熱基礎設施仍須按最終容量規劃。

延伸閱讀

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態
NVIDIA DeveloperAI 硬體

NVIDIA 開源 NVCRE:在 AI 工作負載上線前,自動驗證 GPU 叢集準備狀態

NVIDIA Launches Open-Source NVCRE: Automating GPU Cluster Readiness Validation Before AI Workloads Run

傳統的 GPU 健全狀況檢查常漏掉分散式訓練中的效能瓶頸。NVIDIA 開源的 NVCRE 是一款 Kubernetes 控制器,透過主動執行分散式測試工作負載,在生產部署前精準找出故障與效能退化的節點。

2 分鐘閱讀