複製相同、蒸餾相異:為線性視覺 Transformer 注入預訓練威力的全新初始化策略
Copy the Same, Distill the Difference: A Smart Initialization Paradigm for Linear Vision Transformers
線性視覺 Transformer(Linear ViTs)雖然擁有優異的 $O(N)$ 線性複雜度,但過去缺乏有效的預訓練權重初始化方式,常需從頭訓練且效能不佳。本研究打破了過去認為「只要轉移注意力即可」的迷思,發現 Softmax 與線性注意力權重高度特定,直接複製效果極差。相對地,MLP 權重屬於算子無關,可以直接複製以保留核心特徵表示。結合「直接複製 MLP」與「蒸餾引導線性注意力路由」的 CSDD 策略,成功讓線性 ViT 追平甚至超越原有的 Softmax ViT。
核心重點
MLP 權重直接複製
MLP 權重與特定的注意力算子無關(operator-agnostic),直接複製預訓練 MLP 即可保留大部分的特徵表達能力。
注意力權重轉移失效
傳統 Softmax 與線性注意力架構高度相異(operator-specific),直接複製其權重效果極差,有時甚至比隨機初始化更糟。
注意力路由蒸餾
透過精心設計的損失函數,引導線性注意力模擬 Softmax 的標記路由(token routing)行為,藉此彌補算子差異。
卓越且廣泛的通用性
此策略在多個線性 ViT 變體、多種模型尺寸與不同資料集上均取得一致的性能提升。
技術圖解
為什麼重要
本研究解決了高效率線性視覺模型難以重用既有大型預訓練模型權重的痛點。透過將「複製」與「蒸餾」低成本結合,開發者不需再從頭進行昂貴的高解析度或大規模預訓練,即可快速將傳統 ViT 轉化為適合邊緣運算或高解析度影像處理的高效線性模型,顯著降低了綠色 AI 與邊緣部署的門檻。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
可以怎麼使用
- 1邊緣設備與行動端部署:將大型 Softmax ViT 快速轉換為輕量高效的線性 ViT,並維持極高精度。
- 2高解析度影像任務:在大尺寸圖片處理中,利用線性複雜度降低記憶體開銷,並透過此初始化快速收斂。
限制與注意事項
- 相較於純粹的權重複製,該方法仍需要額外的蒸餾訓練步驟,無法做到完全「零成本」轉換。
- 模型的最終表現上限,仍會受到教師模型(原 Softmax ViT)本身特徵提取能力的限制。
延伸閱讀
預測嵌入向量助力影像生成:全新 NEPA-DiT 框架以超低算力達到更優 FID
Embedding Prediction Helps Image Generation: NEPA-DiT Achieves Superior FID with Much Less Compute
本研究提出 NEPA 框架,在去雜訊過程中動態預測並更新嵌入向量作為引導條件,僅需先前方法三分之一的訓練算力,便能在 ImageNet 上取得 1.32 FID 的優異成果。
MatLoom:用極簡程式空間實現分層式文字生成 PBR 材質
MatLoom: Layered Text-to-Material Generation in a Compact Program Space
MatLoom 是一種用於文字生成材質的極簡程式語言,能驅使大語言模型直接生成可後續編輯的分層式 PBR 材質程式碼,並在提示詞對齊與視覺質感上超越傳統擴散模型。
Looped-DiT:藉由循環 Transformer 區塊實現影像生成的高效運算擴展
Looped-DiT: Scaling Image Generation Efficiency via Recurrent Transformer Blocks
本研究提出 Looped-DiT,在每個去噪步驟中重複運行共享的 Transformer 區塊,使 260M 參數的小模型在多項指標上超越 6.5 倍大的模型,推論運算量降低 4.9 倍。