Aivora
arXiv大型語言模型專業

融合循環與稀疏架構:Looped MoE 的全新縮放定律

Scaling Laws for Looped Mixture of Experts: Combining Recurrence and Sparsity

2 分鐘閱讀
融合循環與稀疏架構:Looped MoE 的全新縮放定律
30 秒看懂

本研究提出「迴圈縮放定律(Loop Scaling Laws)」,首次將循環遞迴(recurrence)與 MoE 稀疏性共同納入縮放定律建模。循環遞迴能在不增加參數的情況下提升計算深度,而 MoE 則在不增加啟用算力的前提下擴充模型容量。實驗證實,MoE 帶來約 3 倍的啟用參數效率提升,循環架構則在推理任務上帶來約 2 倍的總參數效率。在兆級(trillion)Token 規模的訓練中,Looped MoE 在相同算力下能與兩倍大的無迴圈 MoE 性能匹敵,並支援測試時動態縮放。

核心重點

01

首創聯合縮放定律

成功將循環遞迴與 MoE 稀疏性統一在同一個數學架構中,能比以往方法更精準地預測 held-out 損失。

02

互補的雙軸高效優勢

稀疏性在啟用參數上實現約 3 倍效率提升,循環架構則在推理任務上提供約 2 倍的總參數效率。

03

兆級規模實證與測試時縮放

在兆級 Token 規模下,Looped MoE 在同等算力下可媲美兩倍大非迴圈模型,並支援測試時動態縮放。

技術圖解

模型架構對比:傳統架構 vs. 迴圈 MoE
Dense (稠密模型)Standard MoE (標準 MoE)Looped MoE (迴圈 MoE)
啟用參數效率基準 (1x)高 (~3x 效率)高 (~3x 效率)
總參數推理效率基準 (1x)基準 (1x)極高 (~2x 推理效率)
測試時算力縮放不支援不支援支援 (調整遞迴次數)

為什麼重要

這項研究打破了傳統模型縮放的瓶頸。過去研究往往將循環架構與 MoE 割裂看待,而本研究證明兩者結合能產生顯著的協同效應。這為硬體資源(如記憶體、算力)受限的場景提供了關鍵的設計指引。開發者可以在維持較小模型體積(降低記憶體佔用)的同時,透過 MoE 與循環計算,在推理階段動態調整計算資源,實現「測試時縮放(Test-time Scaling)」,為未來的邊緣運算與高效能推理奠定基礎。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1受限硬體部署:在記憶體受限的裝置(如邊緣裝置或個人終端)上部署具備高推理效能的緊湊型大語言模型。
  2. 2測試時動態縮放:根據任務難度,在推理階段動態調整遞迴迴圈次數,難題多算、簡單題少算,藉此優化推理成本。

限制與注意事項

  • 遞迴循環架構可能導致序列推理時的延遲增加,因為其計算深度依賴遞迴,難以進行並行化處理。
  • 縮放定律的參數可能需要針對特定的新型 MoE 路由機制或高度異質的資料集進行額外的校準。

延伸閱讀

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
arXiv大型語言模型

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配

SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability

本研究提出 SCAPO 演算法,藉由半事實提示干預衡量 Token 的穩定性,精準調整強化學習中的信用分配,顯著提升了大型語言模型的數學推理與泛化能力。

2 分鐘閱讀
STEPQuant:空間與時間雙重優化,突破線性注意力循環狀態量化瓶頸
arXiv大型語言模型

STEPQuant:空間與時間雙重優化,突破線性注意力循環狀態量化瓶頸

STEPQuant: Spatial-Temporal Quantization for Linear Attention Recurrent States

本研究提出 STEPQuant 框架,針對線性注意力模型中的循環狀態進行空間與時間維度的後訓練量化,在 6-bit 預算下幾乎無損保留精度,並減少高達 68.7% 的伺服記憶體開銷。

2 分鐘閱讀
LeapQuant:突破線性注意力瓶頸,實現近乎無損的 8-bit 遞迴狀態量化
arXiv大型語言模型

LeapQuant:突破線性注意力瓶頸,實現近乎無損的 8-bit 遞迴狀態量化

LeapQuant: Near-Lossless 8-Bit Recurrent State Quantization for Linear Attention LLMs

LeapQuant 是一種無需訓練的量化方法,透過「逐視窗量化」與「補償 Token」技術,解決線性注意力模型中遞迴狀態量化造成的精度損失,在保持 FP32 級精度的同時,實現高達 1.47 倍的端到端推論加速。

2 分鐘閱讀