統一分佈訓練框架 MGFlow:實現高品質單步視覺生成
MGFlow: Unifying Distributional Training for High-Quality One-Step Visual Generation
單步視覺生成能極大地提高影像生成速度,但其訓練一直缺乏統一的理論指導。本研究提出一個全新的理論框架,利用 Wasserstein 梯度流將全局分佈目標與點對點特徵更新連結。在此框架下,研究團隊開發了 MGFlow,以可調整粒度的混合高斯建模特徵分佈,並引入質量約束樣本分配與配對元件更新來解決模式崩潰。實驗顯示,MGFlow 在 ImageNet 上取得領先成績,並成功將 4B 參數的 FLUX.2 蒸餾為單步生成器,表現超越原版四步模型。
核心重點
統一分佈訓練框架
將分佈建模與匹配差異分離,利用 Wasserstein 梯度流建立全局目標與點對點更新之間的橋樑。
混合高斯流 MGFlow
以高斯混合模型(GMM)表示特徵分佈,支援最佳傳輸與得分匹配,能在全局動差和樣本表徵間調整粒度。
克服模式崩潰
結合質量約束的樣本分配與配對元件更新,解決單純提高混合模型表達力仍無法消除的模式崩潰問題。
單步生成超越多步
在 ImageNet 取得 SOTA 指標,並成功將 FLUX.2 [klein] 4B 改裝為單步生成器,表現擊敗原版 4 步模型。
技術圖解
為什麼重要
這項研究為單步圖像生成(如模型蒸餾與加速)奠定了更強的數學基礎。傳統方法如 FD-Loss 常受限於單一高斯假設,而 MGFlow 提供更靈活的混合高斯表徵。這不僅在理論上更優雅,更在實際的大型文字生成圖像模型(如 FLUX.2)上展現出極強的實用價值,讓極速的單步生成達到甚至超越傳統多步生成的精細度。
對誰有影響
- AI 開發者
- AI 研究人員
可以怎麼使用
- 1將現有大型擴散模型快速 post-train 蒸餾為超快速的單步生成模型。
- 2在高解析度影像合成任務中,加速生成流程並降低計算延遲。
限制與注意事項
- 儘管 MGFlow 理論上支援可調節粒度,但在極高維度的特徵空間中,混合高斯的分佈建模和分配仍面臨計算複雜度的挑戰。
- 目前主要在凍結的特徵表徵空間中進行特徵匹配,生成品質仍受限於該特徵提取器的表徵能力。
延伸閱讀

Meta 發表 Muse Image 與 Muse Video:首款導入 Agentic 機制與推理期算力擴展的媒體生成模型
Meta Introduces Muse Image and Muse Video: Advancing Media Generation with Agentic Tools and Compute Scaling
Meta 推出最新影像生成模型 Muse Image 與影片模型 Muse Video,首次將 Agentic 工具調用、自我修正和推理期算力擴展引入多媒體生成領域。