Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構
Introducing Olmo-core 3: Open, Scalable Training Infrastructure for Trillion-Parameter MoEs

Olmo-core 3 重新設計了 MoE 訓練系統,將原有的 FSDP 架構轉為基於 DDP 的設計,讓專家網路常駐 GPU 以減少權重傳輸。在 NVIDIA B300 GPU 測試中,47B MoE 模型的訓練吞吐量比舊版提升了 2.7 倍。此系統不僅能擴展至兆級參數,更支援 MXFP8 低精度格式、專家平行與分散式優化器等多種技術,為開源社群提供高效的巨型模型訓練工具。
核心重點
GPU 常駐專家設計
從 FSDP 轉向基於 DDP 的架構,將專家網路常駐於 GPU 上並路由資料,免去重複聚集權重的通訊開銷。
吞吐量提升 2.7 倍
在 8 顆 B300 GPU 上測試 47B MoE,吞吐量從舊版的每秒 19,400 token 提升至 52,000 token。
兆級參數擴展力
成功在 512 顆 GPU 上測試 1.2 兆參數模型,並透過 DeepEP v2 實現高達 2.38 兆參數的容量測試。
支援 MXFP8 低精度
相較於 BF16,使用 MXFP8 可提升約 21% 的訓練吞吐量,並將峰值記憶體從 103 GiB 降至 95 GiB。
技術圖解
| 舊版 Olmo-core (FSDP) | 全新 Olmo-core 3 (DDP) | |
|---|---|---|
| 專家置放策略 | 頻繁重新聚集與切分權重 (Gather & Reshard) | 常駐於 GPU 並直接路由資料 (Resident on GPUs) |
| 47B MoE 吞吐量 (B300) | 19,400 tokens/sec/GPU | 52,000 tokens/sec/GPU (提升 2.7 倍) |
| 最大測試參數規模 | 數十億參數級別 (Billions) | 最高達 2.38 兆參數 (Trillion-scale) |
為什麼重要
訓練大型 MoE 模型通常面臨極高的硬體成本與通訊瓶頸,這使得學術界與中小型實驗室難以企及。Olmo-core 3 透過完全開源的訓練架構、最佳化的平行運算與路由機制,降低了兆級參數模型的開發門檻。這不僅釋放了更高效率的運算潛能,也讓模型權重背後的「訓練決策與基礎建設」同樣走向開放,推動更透明的 AI 研究。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1學術機構與開源社群利用現有 GPU 叢集訓練超大型 MoE 模型。
- 2利用 MXFP8 低精度與分散式優化器減少大規模訓練時的硬體記憶體佔用。
限制與注意事項
- 在獨立 GPU 串流上重疊(Overlap)通訊與計算在某些測試中反而會降低整體訓練吞吐量。
- 平衡路由分數可能存在「Token 傑利蠑螈(Token Gerrymandering)」現象,即路由指標改善但實際負載並未更平衡。
延伸閱讀
TACO 最佳化器:將 32B 大模型全參數微調帶入單張 GPU 的極簡幾何學
TACO Optimizer: Unleashing Full-Parameter 32B LLM Fine-Tuning on a Single GPU
TACO 是一款新型超低記憶體最佳化器,透過在權重矩陣每行中僅保留最大幅度的梯度符號,將最佳化器狀態記憶體縮減 174 倍,讓單張 GPU 即可微調 32B 模型。
層級連續擴散語言模型:結合離散 Token 與連續潛在軌跡的全新生成架構
Hierarchical Continuous Diffusion Language Models: Coupling Discrete Tokens with Continuous Latents
HC-DLM 透過將離散 Token 生成與連續潛在軌跡結合於單一去噪過程中,克服了傳統離散與連續擴散語言模型的局限性,在結構化推理與語言建模任務上表現優異。
SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability
本研究提出 SCAPO 演算法,藉由半事實提示干預衡量 Token 的穩定性,精準調整強化學習中的信用分配,顯著提升了大型語言模型的數學推理與泛化能力。