Aivora
Hugging Face大型語言模型專業

Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構

Introducing Olmo-core 3: Open, Scalable Training Infrastructure for Trillion-Parameter MoEs

2 分鐘閱讀
Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構
30 秒看懂

Olmo-core 3 重新設計了 MoE 訓練系統,將原有的 FSDP 架構轉為基於 DDP 的設計,讓專家網路常駐 GPU 以減少權重傳輸。在 NVIDIA B300 GPU 測試中,47B MoE 模型的訓練吞吐量比舊版提升了 2.7 倍。此系統不僅能擴展至兆級參數,更支援 MXFP8 低精度格式、專家平行與分散式優化器等多種技術,為開源社群提供高效的巨型模型訓練工具。

核心重點

01

GPU 常駐專家設計

從 FSDP 轉向基於 DDP 的架構,將專家網路常駐於 GPU 上並路由資料,免去重複聚集權重的通訊開銷。

02

吞吐量提升 2.7 倍

在 8 顆 B300 GPU 上測試 47B MoE,吞吐量從舊版的每秒 19,400 token 提升至 52,000 token。

03

兆級參數擴展力

成功在 512 顆 GPU 上測試 1.2 兆參數模型,並透過 DeepEP v2 實現高達 2.38 兆參數的容量測試。

04

支援 MXFP8 低精度

相較於 BF16,使用 MXFP8 可提升約 21% 的訓練吞吐量,並將峰值記憶體從 103 GiB 降至 95 GiB。

技術圖解

Olmo-core 版本架構與效能比較
舊版 Olmo-core (FSDP)全新 Olmo-core 3 (DDP)
專家置放策略頻繁重新聚集與切分權重 (Gather & Reshard)常駐於 GPU 並直接路由資料 (Resident on GPUs)
47B MoE 吞吐量 (B300)19,400 tokens/sec/GPU52,000 tokens/sec/GPU (提升 2.7 倍)
最大測試參數規模數十億參數級別 (Billions)最高達 2.38 兆參數 (Trillion-scale)

為什麼重要

訓練大型 MoE 模型通常面臨極高的硬體成本與通訊瓶頸,這使得學術界與中小型實驗室難以企及。Olmo-core 3 透過完全開源的訓練架構、最佳化的平行運算與路由機制,降低了兆級參數模型的開發門檻。這不僅釋放了更高效率的運算潛能,也讓模型權重背後的「訓練決策與基礎建設」同樣走向開放,推動更透明的 AI 研究。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1學術機構與開源社群利用現有 GPU 叢集訓練超大型 MoE 模型。
  2. 2利用 MXFP8 低精度與分散式優化器減少大規模訓練時的硬體記憶體佔用。

限制與注意事項

  • 在獨立 GPU 串流上重疊(Overlap)通訊與計算在某些測試中反而會降低整體訓練吞吐量。
  • 平衡路由分數可能存在「Token 傑利蠑螈(Token Gerrymandering)」現象,即路由指標改善但實際負載並未更平衡。

延伸閱讀

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
arXiv大型語言模型

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配

SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability

本研究提出 SCAPO 演算法,藉由半事實提示干預衡量 Token 的穩定性,精準調整強化學習中的信用分配,顯著提升了大型語言模型的數學推理與泛化能力。

2 分鐘閱讀