Aivora
arXiv影像 AI專業

預測嵌入向量助力影像生成:全新 NEPA-DiT 框架以超低算力達到更優 FID

Embedding Prediction Helps Image Generation: NEPA-DiT Achieves Superior FID with Much Less Compute

2 分鐘閱讀
預測嵌入向量助力影像生成:全新 NEPA-DiT 框架以超低算力達到更優 FID
30 秒看懂

傳統的擴散 Transformer (DiT) 在去雜訊時,通常只在開始時將類別標籤或文字提示嵌入一次,並在所有步驟中重複使用。本研究提出「下一個嵌入預測自迴歸」(NEPA),訓練一個 Transformer 來預測連續的嵌入向量。藉由「多嵌入預測」,NEPA 能在每個去雜訊步驟中重新計算並預測乾淨影像的嵌入,提供可適應當前雜訊狀態的動態條件。實驗顯示,結合 REPA 的 NEPA-DiT-XL 模型在 ImageNet 256x256 上達到 1.32 FID 的極佳表現,且所需訓練算力僅為 REPA 的三分之一。

核心重點

01

動態條件機制

打破傳統 DiT 重複使用靜態條件的限制,NEPA 能在每個去雜訊步驟中根據當前雜訊狀態動態更新預測的嵌入向量。

02

下一個嵌入預測

將乾淨影像的嵌入視為接續在雜訊影像之後的序列目標,利用 Transformer 一次預測出所有的連續嵌入。

03

訓練算力大幅縮減

結合 REPA 的 NEPA-DiT-XL 模型,僅需約三分之一的訓練算力,便能達到 1.32 的頂尖 FID 分數。

技術圖解

NEPA 動態條件生成流程
輸入輸入當前狀態預測乾淨影像嵌入動態條件引導去雜訊輸入輸出原始標籤/提示當前雜訊影像 xtNEPA 預測網路預測的乾淨嵌入DiT 生成器去雜訊影像 xt-1

為什麼重要

這項研究為擴散模型的架構設計開闢了新路徑。影像生成模型的訓練成本一向高昂,NEPA 證明了透過「預測嵌入」提供動態引導,不僅能大幅提升生成品質(FID 達 1.32),還能將所需的訓練算力削減至原本的三分之一。這有助於降低高畫質影像生成的門檻,讓運算資源有限的研究團隊與企業也能訓練出頂尖的模型。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 企業決策者

可以怎麼使用

  1. 1高效能影像生成
  2. 2擴散模型去雜訊流程優化

限制與注意事項

  • 推論取樣時的計算開銷增加,因為在每個取樣步驟中都需額外運行一個 NEPA 預測網路。
  • 高度依賴底層預訓練嵌入空間的語意品質與連續性。

延伸閱讀

MatLoom:用極簡程式空間實現分層式文字生成 PBR 材質
arXiv影像 AI

MatLoom:用極簡程式空間實現分層式文字生成 PBR 材質

MatLoom: Layered Text-to-Material Generation in a Compact Program Space

MatLoom 是一種用於文字生成材質的極簡程式語言,能驅使大語言模型直接生成可後續編輯的分層式 PBR 材質程式碼,並在提示詞對齊與視覺質感上超越傳統擴散模型。

2 分鐘閱讀
統一分佈訓練框架 MGFlow:實現高品質單步視覺生成
arXiv影像 AI

統一分佈訓練框架 MGFlow:實現高品質單步視覺生成

MGFlow: Unifying Distributional Training for High-Quality One-Step Visual Generation

本研究提出一個統一的理論框架,將分佈建模與匹配差異分離,並推出 MGFlow 方法,透過混合高斯與 Wasserstein 梯度流,大幅提升單步圖像生成品質並超越多步模型。

2 分鐘閱讀