Aivora
arXivAI 研究專業

如何循環混合專家模型?全新 Foil 架構實現專家扁平化與注意力機制解耦

How to Loop MoE: Foil Architecture Flattens Experts and Unties Attention

2 分鐘閱讀
如何循環混合專家模型?全新 Foil 架構實現專家扁平化與注意力機制解耦
30 秒看懂

循環 Transformer 重複使用層區塊以提升參數利用率,而 MoE 模型則限制每個 token 的計算開銷。本文提出 Foil 架構,在保持專家參數與計算量不變的前提下解決了兩者結合的難題。Foil 包含兩大核心設計:第一是「扁平化專家」,將專家層數減半、單層專家數加倍,並將循環次數加倍,擴大路由選擇範圍;第二是「解耦注意力」,讓每次循環擁有獨立的注意力參數,而專家與路由器共享。在 100B token 預訓練實驗中,Foil 顯著降低了預訓練損失值,且下游任務表現優異。

核心重點

01

融合循環與稀疏架構

結合循環 Transformer(重複使用層)與 MoE(稀疏活化)的優勢,在不增加計算資源的情況下提高參數利用效率。

02

專家網路扁平化

將專家層數減半、每層專家數加倍,並將循環次數加倍,讓每次路由決定都有更大的專家池可供選擇。

03

解耦注意力參數

在每一次循環中為注意力機制配備獨立參數,而專家網路與路由器則維持共享,藉此提高路由的平衡度與置信度。

04

更低的預訓練損失值

在 100B token 的預訓練中,最扁平化的 Foil 損失值較基準模型降低了 0.012 nat,且下游任務精確度同樣出色。

技術圖解

Foil 架構與傳統 Looped MoE 基準之對比
Baseline (Unflattened Looped MoE)Foil (Flattened & Untied MoE)
專家層數 (Expert Layers)較多層(正常層數)層數減半(扁平化)
單層專家數 (Experts per Layer)較少專家專家數量加倍
循環次數 (Passes)基礎循環次數循環次數加倍
注意力參數 (Attention)在循環間完全共享 (Shared)每次循環配備獨立參數 (Untied)
專家與路由器 (Experts/Routers)共享保持共享

為什麼重要

在硬體資源受限的環境中,如何最大化模型容量與參數效率至關重要。Looped MoE 為輕量級且高容量的模型設計開闢了新方向。Foil 架構證明了藉由調整模型結構(扁平化專家)與適度解耦特定模組(注意力機制),可以在完全不增加參數與計算預算的前提下,大幅提升稀疏模型在重複循環時的效能與路由表現,為未來邊緣裝置或高效能輕量模型的部署提供了實用指南。

對誰有影響

  • AI 研究人員
  • AI 開發者

可以怎麼使用

  1. 1記憶體受限環境下的高效大語言模型部署
  2. 2在固定計算預算下最大化預訓練與推理效率

限制與注意事項

  • 由於循環次數(Passes)加倍,可能會對序列處理的延遲(Latency)產生影響。
  • 雖然注意力參數已解耦,但高度共享專家網路在超大規模模型上的泛化性仍有待驗證。

延伸閱讀

自我監督信心訓練:免於刻意「學會停止」即可提升 LLM 推理效率
arXivAI 研究

自我監督信心訓練:免於刻意「學會停止」即可提升 LLM 推理效率

Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency

研究人員發現,透過自我監督讓推理模型在訓練中預測自身答案的信心度,即使不引入長度限制或提前終止機制,也能在推論時自然減少高達 25% 的 token 消耗並保持相同準確度。

2 分鐘閱讀