預測嵌入向量助力影像生成:全新 NEPA-DiT 框架以超低算力達到更優 FID
Embedding Prediction Helps Image Generation: NEPA-DiT Achieves Superior FID with Much Less Compute
傳統的擴散 Transformer (DiT) 在去雜訊時,通常只在開始時將類別標籤或文字提示嵌入一次,並在所有步驟中重複使用。本研究提出「下一個嵌入預測自迴歸」(NEPA),訓練一個 Transformer 來預測連續的嵌入向量。藉由「多嵌入預測」,NEPA 能在每個去雜訊步驟中重新計算並預測乾淨影像的嵌入,提供可適應當前雜訊狀態的動態條件。實驗顯示,結合 REPA 的 NEPA-DiT-XL 模型在 ImageNet 256x256 上達到 1.32 FID 的極佳表現,且所需訓練算力僅為 REPA 的三分之一。
核心重點
動態條件機制
打破傳統 DiT 重複使用靜態條件的限制,NEPA 能在每個去雜訊步驟中根據當前雜訊狀態動態更新預測的嵌入向量。
下一個嵌入預測
將乾淨影像的嵌入視為接續在雜訊影像之後的序列目標,利用 Transformer 一次預測出所有的連續嵌入。
訓練算力大幅縮減
結合 REPA 的 NEPA-DiT-XL 模型,僅需約三分之一的訓練算力,便能達到 1.32 的頂尖 FID 分數。
技術圖解
為什麼重要
這項研究為擴散模型的架構設計開闢了新路徑。影像生成模型的訓練成本一向高昂,NEPA 證明了透過「預測嵌入」提供動態引導,不僅能大幅提升生成品質(FID 達 1.32),還能將所需的訓練算力削減至原本的三分之一。這有助於降低高畫質影像生成的門檻,讓運算資源有限的研究團隊與企業也能訓練出頂尖的模型。
對誰有影響
- AI 研究人員
- AI 開發者
- 企業決策者
可以怎麼使用
- 1高效能影像生成
- 2擴散模型去雜訊流程優化
限制與注意事項
- 推論取樣時的計算開銷增加,因為在每個取樣步驟中都需額外運行一個 NEPA 預測網路。
- 高度依賴底層預訓練嵌入空間的語意品質與連續性。
延伸閱讀
MatLoom:用極簡程式空間實現分層式文字生成 PBR 材質
MatLoom: Layered Text-to-Material Generation in a Compact Program Space
MatLoom 是一種用於文字生成材質的極簡程式語言,能驅使大語言模型直接生成可後續編輯的分層式 PBR 材質程式碼,並在提示詞對齊與視覺質感上超越傳統擴散模型。
Looped-DiT:藉由循環 Transformer 區塊實現影像生成的高效運算擴展
Looped-DiT: Scaling Image Generation Efficiency via Recurrent Transformer Blocks
本研究提出 Looped-DiT,在每個去噪步驟中重複運行共享的 Transformer 區塊,使 260M 參數的小模型在多項指標上超越 6.5 倍大的模型,推論運算量降低 4.9 倍。
統一分佈訓練框架 MGFlow:實現高品質單步視覺生成
MGFlow: Unifying Distributional Training for High-Quality One-Step Visual Generation
本研究提出一個統一的理論框架,將分佈建模與匹配差異分離,並推出 MGFlow 方法,透過混合高斯與 Wasserstein 梯度流,大幅提升單步圖像生成品質並超越多步模型。