Aivora
arXiv影片 AI專業

PDMD:投影分佈匹配蒸餾技術,解決影片擴散模型的一步生成偽影

PDMD: Stabilizing Video Diffusion Distillation via Projected Distribution Matching

2 分鐘閱讀
PDMD:投影分佈匹配蒸餾技術,解決影片擴散模型的一步生成偽影
30 秒看懂

影片擴散模型通常需要數十次去噪步驟,極耗計算資源。「分佈匹配蒸餾 (DMD)」能將步驟縮減至僅 4 步(NFE),但訓練過程中因「評論家 (critic)」誤差累積,容易導致影片過飽和與產生異常紋理。本研究提出 PDMD(投影分佈匹配蒸餾),透過將 DMD 的更新向量投影至特定幾何方向,在不丟失理想訊號的前提下過濾掉評論家誤差。此方法極其簡單(僅需修改一行程式碼,不增加額外模型或損失函數),並在 Wan2.1 和 MiniMax-H3 影音生成模型上取得領先的 VBench 與 VideoGen-Eval 評估成績。

核心重點

01

解決評論家誤差累積

找出 DMD 蒸餾中影片過飽和與偽影的根源,證實其來自評論家誤差在多次學生模型更新中累積。

02

正交投影幾何過濾

將 DMD 更新向量投影到與「學生-評論家終點殘差」垂直的空間,在高維假設下可消除大量誤差並保留核心訊號。

03

極簡的單行程式碼修改

實作極其簡單,只需對原始 DMD 程式碼進行一行修改,不需額外損失函數、多階段訓練或額外網路結構。

04

領先的 4-NFE 影音生成指標

在 Wan2.1 4-NFE 下取得 83.73 的 VBench 分數;並在 MiniMax-H3 影音生成上取得 83.17 的最佳視覺分數與領先音訊指標。

技術圖解

PDMD 投影過濾流程
輸入雜訊 (Query)學生模型預測評論家模型預測計算終點殘差原始 DMD 更新向量PDMD 投影過濾無誤差學生更新

為什麼重要

將大型影片與多模態擴散模型蒸餾至僅需極少步驟(如 4 步)是實現即時應用的關鍵。PDMD 提供了一種優雅且具數學實證的幾何過濾方法,完全解決了快速蒸餾模型訓練不穩定的痛點,而且無需任何額外的計算與硬體負擔,非常適合在工業界的大規模影片生成工作流中推廣。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1極速影片生成模型蒸餾(如 Wan2.1 4步推理)
  2. 2高品質聯合影音同步生成(如 MiniMax-H3 蒸餾)

限制與注意事項

  • 仍屬於蒸餾方法,需要針對特定的基礎模型進行額外的離線蒸餾訓練。
  • 數學證明基於高維度空間假設,在極低維度或高度受限的表徵空間下其過濾效果可能受限。