突破均勻分佈陷阱:透過 SplitMoE 解決影片擴散模型的擴展瓶頸
Breaking the Uniformity Trap: Scaling Video Diffusion Models via SplitMoE
將大型語言模型中常用的混合專家模型(MoE)直接套用於影片生成時,會因強制將 Token 均勻分配給各個專家,進而割裂空間上連續的影片區塊,造成畫面失真。本研究提出的 SplitMoE 突破了此限制。它將專家池劃分為負責高階語意抽象的「語意專家」與保留底層視覺細節的「通用專家」,並結合原型引導路由與拉推正規化技術。在相同運算資源預算下,SplitMoE 能讓 Token 依據語意特徵自然聚集,顯著提升影片生成品質與收斂速度。
核心重點
直擊均勻分佈陷阱
傳統 MoE 強制均勻路由,這與具備時空冗餘和語意長尾效應的影片資料不相容,容易導致畫面區塊碎裂與結構失真。
雙重專家角色分工
將專家池明確拆分為專攻高階語意的「語意專家」與保留剩餘視覺資訊的「通用專家」,打破傳統同質專家池的限制。
原型引導與拉推機制
拋棄硬性的平衡限制,利用原型引導讓 Token 依據語意特徵自然聚集,實現更連貫的特徵處理。
由粗到細的去噪軌跡
實驗發現 SplitMoE 在去噪過程中展現出「由粗到細」的邏輯,為大型影片世界模型提供了一條具備模態感知能力的擴展路徑。
技術圖解
| 傳統視覺 MoE (Traditional MoE) | SplitMoE (本研究提出) | |
|---|---|---|
| 專家池結構 | 同質專家池 (Homogeneous pool) | 異質雙重專家 (Semantic + Generic) |
| 路由原則 | 強制均勻平衡分流 (Enforced uniformity) | 原型引導與拉推非均勻分流 (Prototype-guided) |
| 視覺連貫性 | 易發生路由碎裂與結構失真 | 自然依語意聚集,保持視覺連貫 |
| 去噪軌跡 | 無明顯階段分工 (Unstructured) | 湧現由粗到細的去噪邏輯 (Coarse-to-fine) |
為什麼重要
隨著影片生成與「世界模型」的需求爆發,如何高效擴展影片擴散模型成為關鍵。SplitMoE 證明了「非均勻、角色分工」的稀疏架構比直接套用 LLM 的 MoE 更適合影片資料。這不僅能在相同運算預算下取得更好的表現、降低運算成本,也為未來超大型影片生成模型與物理世界模擬器提供了更科學的架構指引。
對誰有影響
- AI 開發者
- AI 研究人員
可以怎麼使用
- 1高品質、高解析度影片生成模型的架構設計
- 2大型影片世界模型(Video World Models)的運算效率擴展
限制與注意事項
- 語意專家與通用專家之間的最優配置比例,可能需針對不同影片數據集進行微調。
- 作為新型動態路由架構,在現有標準硬體上的分散式訓練並行優化可能需要額外的工程調校。
延伸閱讀

NVIDIA VSS Blueprint 3.3 登場:以智慧採樣與 AI 代理技能,大幅降低視覺 AI 部署成本
NVIDIA VSS Blueprint 3.3: Lowering Visual AI Agent Costs with Smart Sampling and Agent Skills
NVIDIA 推出 VSS Blueprint 3.3,透過全新的視覺代理建構技能與自適應高效視訊採樣(Adaptive EVS)技術,大幅簡化多工作流開發流程並減少高達 80% 的 VLM 輸入 Token,顯著降低開發與運行成本。
超越時間線:利用「實體自傳」增強 AI 的長影片記憶與物體追蹤能力
Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies
本研究提出 Grounded Entity Biographies (GEB) 記憶框架,將影片中同一物理實體的跨片段視覺觀測,自動串聯成可檢索的「實體自傳」,大幅提升 AI 在長達數天之長影片問答中的物體追蹤與識別能力。
PDMD:投影分佈匹配蒸餾技術,解決影片擴散模型的一步生成偽影
PDMD: Stabilizing Video Diffusion Distillation via Projected Distribution Matching
PDMD 藉由將 DMD 的更新向量投影到與「學生-評論家終點殘差」正交的空間,有效過濾評論家誤差,僅需修改一行程式碼即可在 4 步 NFE 下生成高品質、無偽影的影片與音訊。