Aivora
arXiv影像 AI專業

統一分佈訓練框架 MGFlow:實現高品質單步視覺生成

MGFlow: Unifying Distributional Training for High-Quality One-Step Visual Generation

2 分鐘閱讀
統一分佈訓練框架 MGFlow:實現高品質單步視覺生成
30 秒看懂

單步視覺生成能極大地提高影像生成速度,但其訓練一直缺乏統一的理論指導。本研究提出一個全新的理論框架,利用 Wasserstein 梯度流將全局分佈目標與點對點特徵更新連結。在此框架下,研究團隊開發了 MGFlow,以可調整粒度的混合高斯建模特徵分佈,並引入質量約束樣本分配與配對元件更新來解決模式崩潰。實驗顯示,MGFlow 在 ImageNet 上取得領先成績,並成功將 4B 參數的 FLUX.2 蒸餾為單步生成器,表現超越原版四步模型。

核心重點

01

統一分佈訓練框架

將分佈建模與匹配差異分離,利用 Wasserstein 梯度流建立全局目標與點對點更新之間的橋樑。

02

混合高斯流 MGFlow

以高斯混合模型(GMM)表示特徵分佈,支援最佳傳輸與得分匹配,能在全局動差和樣本表徵間調整粒度。

03

克服模式崩潰

結合質量約束的樣本分配與配對元件更新,解決單純提高混合模型表達力仍無法消除的模式崩潰問題。

04

單步生成超越多步

在 ImageNet 取得 SOTA 指標,並成功將 FLUX.2 [klein] 4B 改裝為單步生成器,表現擊敗原版 4 步模型。

技術圖解

MGFlow 運作流程與優化架構
特徵對齊特徵對齊分配樣本計算點對點更新更新生成器參數真實圖像特徵生成圖像特徵混合高斯建模質量約束樣本分配Wasserstein 梯度更新優化後的單步生成器

為什麼重要

這項研究為單步圖像生成(如模型蒸餾與加速)奠定了更強的數學基礎。傳統方法如 FD-Loss 常受限於單一高斯假設,而 MGFlow 提供更靈活的混合高斯表徵。這不僅在理論上更優雅,更在實際的大型文字生成圖像模型(如 FLUX.2)上展現出極強的實用價值,讓極速的單步生成達到甚至超越傳統多步生成的精細度。

對誰有影響

  • AI 開發者
  • AI 研究人員

可以怎麼使用

  1. 1將現有大型擴散模型快速 post-train 蒸餾為超快速的單步生成模型。
  2. 2在高解析度影像合成任務中,加速生成流程並降低計算延遲。

限制與注意事項

  • 儘管 MGFlow 理論上支援可調節粒度,但在極高維度的特徵空間中,混合高斯的分佈建模和分配仍面臨計算複雜度的挑戰。
  • 目前主要在凍結的特徵表徵空間中進行特徵匹配,生成品質仍受限於該特徵提取器的表徵能力。

延伸閱讀