如何循環混合專家模型?全新 Foil 架構實現專家扁平化與注意力機制解耦
How to Loop MoE: Foil Architecture Flattens Experts and Unties Attention
循環 Transformer 重複使用層區塊以提升參數利用率,而 MoE 模型則限制每個 token 的計算開銷。本文提出 Foil 架構,在保持專家參數與計算量不變的前提下解決了兩者結合的難題。Foil 包含兩大核心設計:第一是「扁平化專家」,將專家層數減半、單層專家數加倍,並將循環次數加倍,擴大路由選擇範圍;第二是「解耦注意力」,讓每次循環擁有獨立的注意力參數,而專家與路由器共享。在 100B token 預訓練實驗中,Foil 顯著降低了預訓練損失值,且下游任務表現優異。
核心重點
融合循環與稀疏架構
結合循環 Transformer(重複使用層)與 MoE(稀疏活化)的優勢,在不增加計算資源的情況下提高參數利用效率。
專家網路扁平化
將專家層數減半、每層專家數加倍,並將循環次數加倍,讓每次路由決定都有更大的專家池可供選擇。
解耦注意力參數
在每一次循環中為注意力機制配備獨立參數,而專家網路與路由器則維持共享,藉此提高路由的平衡度與置信度。
更低的預訓練損失值
在 100B token 的預訓練中,最扁平化的 Foil 損失值較基準模型降低了 0.012 nat,且下游任務精確度同樣出色。
技術圖解
| Baseline (Unflattened Looped MoE) | Foil (Flattened & Untied MoE) | |
|---|---|---|
| 專家層數 (Expert Layers) | 較多層(正常層數) | 層數減半(扁平化) |
| 單層專家數 (Experts per Layer) | 較少專家 | 專家數量加倍 |
| 循環次數 (Passes) | 基礎循環次數 | 循環次數加倍 |
| 注意力參數 (Attention) | 在循環間完全共享 (Shared) | 每次循環配備獨立參數 (Untied) |
| 專家與路由器 (Experts/Routers) | 共享 | 保持共享 |
為什麼重要
在硬體資源受限的環境中,如何最大化模型容量與參數效率至關重要。Looped MoE 為輕量級且高容量的模型設計開闢了新方向。Foil 架構證明了藉由調整模型結構(扁平化專家)與適度解耦特定模組(注意力機制),可以在完全不增加參數與計算預算的前提下,大幅提升稀疏模型在重複循環時的效能與路由表現,為未來邊緣裝置或高效能輕量模型的部署提供了實用指南。
對誰有影響
- AI 研究人員
- AI 開發者
可以怎麼使用
- 1記憶體受限環境下的高效大語言模型部署
- 2在固定計算預算下最大化預訓練與推理效率
限制與注意事項
- 由於循環次數(Passes)加倍,可能會對序列處理的延遲(Latency)產生影響。
- 雖然注意力參數已解耦,但高度共享專家網路在超大規模模型上的泛化性仍有待驗證。
延伸閱讀
FurE:免用動物毛髮資料集,實現 10 倍加速的 3D 動物毛髮重建技術
FurE: 10x Faster 3D Animal Fur Reconstruction Without Animal Datasets
FurE 是一種高效的 3D 動物毛髮重建方法,利用人類頭髮資料訓練的 PCA 解碼器與高斯糖霜技術,在無需任何動物毛髮資料集的情況下,實現 10 倍速的細緻且可編輯毛髮重建。
讓多模態模型自我修正!UMM-Reflection 透過交錯強化學習實現原生圖像生成反思
Self-Correcting Multimodal Models: UMM-Reflection Enables Native Image Generation Repair via Interleaved RL
本研究提出 UMM-Reflection 方法,利用交錯強化學習,讓單一多模態模型學會自我診斷與修正所生成的圖像,無需外部審查器即可顯著提升生成品質。
自我監督信心訓練:免於刻意「學會停止」即可提升 LLM 推理效率
Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency
研究人員發現,透過自我監督讓推理模型在訓練中預測自身答案的信心度,即使不引入長度限制或提前終止機制,也能在推論時自然減少高達 25% 的 token 消耗並保持相同準確度。