突破億級變數極限!NVIDIA cuOpt 推出多 GPU 線性規劃求解器 mPDLP
Scaling to 100 Million Variables: NVIDIA cuOpt Introduces mPDLP Multi-GPU LP Solver

為解決超大型線性規劃(LP)帶來的單卡記憶體與運算瓶頸,NVIDIA cuOpt 推出全新 mPDLP 求解器。該技術將 LP 問題分發至由 NVLink 連接的多顆 GPU,並採用「最小割分割」技術,依矩陣稀疏結構減少 GPU 間的通訊開銷。實驗顯示,在超過千萬非零元素的超大問題中,mPDLP 能顯著加速,且單卡峰值記憶體使用量最高可降低 6 倍,協助企業快速完成億級變數的複雜決策優化。
核心重點
多 GPU 分散式架構
透過 NVLink、NVSwitch 與 NCCL,將線性規劃問題分散至多顆 GPU 運算,突破單卡記憶體限制。
最小割圖分割技術
將約束矩陣轉為雙分圖,並在分割時最小化跨 GPU 的邊緣切割,極大地保留資料局部性並減少通訊延遲。
顯著降低記憶體與加速
提供高達 6 倍的單 GPU 峰值記憶體降幅,且在非零元素超過千萬的超大型問題上展現出顯著的加速優勢。
技術圖解
為什麼重要
對於全球供應鏈管理與電網調度等高度複雜的決策場景,決策時間往往有嚴格限制。NVIDIA cuOpt mPDLP 的推出,讓企業能在幾分鐘而非幾小時內,解決包含數億個變數與約束條件的數學規劃模型。這不僅實現了更即時、更大規模的情境模擬與不確定性分析,更將決策優化推向全新的規模極限,促使企業從傳統的粗放式規劃走向精準的即時最佳化。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1全球供應鏈與生產規劃,例如 Kinaxis 在其 Maestro 平台上優化包含超過 1.35 億個變數的 CPG 供應鏈模型。
- 2大型能源系統容量擴張調度,例如 PSR 在其隨機能源擴張模型中優化 1.85 億個變數。
限制與注意事項
- 當線性規劃問題規模較小(非零元素少於 1000 萬)時,多 GPU 同步與資料傳輸的開銷將超過並行運算的益處,可能導致效能不如單卡。
- 效能高度依賴約束矩陣的稀疏結構。若分割後的邊緣切割比例過高,跨 GPU 通訊將大幅增加,甚至抵消或反轉加速效果。
延伸閱讀
打造過目不忘的 3D 空間記憶:Ledger 如何透過第一人稱影片追蹤隱形物體
Building Persistent 3D Object Memory: How Ledger Tracks Objects from Egocentric Videos
普林斯頓等機構的研究人員提出 Ledger 框架,透過第一人稱視角影片為具身智慧助理建立持久的 3D 物體記憶,大幅提升空間定位與問答的準確度。
探索與優化解耦:全新強化學習框架 ExpDis 提升大語言模型的推理多元性
Decoupling Exploration from Optimization: How ExpDis Boosts LLM Reasoning and Solution Diversity
本研究提出 ExpDis 框架,將強化學習中的「探索」與「優化」解耦。透過訓練帶有新穎性獎勵的探索者模型,篩選正確解法並蒸餾至學生模型,解決了傳統 RLVR 因過度探索導致模型退化的難題。
去中心化 SGD 克服重尾雜訊:梯度裁剪如何實現最佳收斂與線性加速
Clipped Decentralized SGD: Achieving Optimal Convergence and Linear Speed-Up Under Heavy-Tailed Noise
本研究證明了在重尾雜訊下,採用梯度裁剪的去中心化 SGD(DSGD)能達到最佳收斂率,並在非凸優化中首次實現了隨節點數量增加的線性加速。