Aivora
arXiv影像 AI進階

複製相同、蒸餾相異:為線性視覺 Transformer 注入預訓練威力的全新初始化策略

Copy the Same, Distill the Difference: A Smart Initialization Paradigm for Linear Vision Transformers

2 分鐘閱讀
複製相同、蒸餾相異:為線性視覺 Transformer 注入預訓練威力的全新初始化策略
30 秒看懂

線性視覺 Transformer(Linear ViTs)雖然擁有優異的 $O(N)$ 線性複雜度,但過去缺乏有效的預訓練權重初始化方式,常需從頭訓練且效能不佳。本研究打破了過去認為「只要轉移注意力即可」的迷思,發現 Softmax 與線性注意力權重高度特定,直接複製效果極差。相對地,MLP 權重屬於算子無關,可以直接複製以保留核心特徵表示。結合「直接複製 MLP」與「蒸餾引導線性注意力路由」的 CSDD 策略,成功讓線性 ViT 追平甚至超越原有的 Softmax ViT。

核心重點

01

MLP 權重直接複製

MLP 權重與特定的注意力算子無關(operator-agnostic),直接複製預訓練 MLP 即可保留大部分的特徵表達能力。

02

注意力權重轉移失效

傳統 Softmax 與線性注意力架構高度相異(operator-specific),直接複製其權重效果極差,有時甚至比隨機初始化更糟。

03

注意力路由蒸餾

透過精心設計的損失函數,引導線性注意力模擬 Softmax 的標記路由(token routing)行為,藉此彌補算子差異。

04

卓越且廣泛的通用性

此策略在多個線性 ViT 變體、多種模型尺寸與不同資料集上均取得一致的性能提升。

技術圖解

複製相同、蒸餾相異 (CSDD) 初始化架構
拆分架構拆分架構直接複製 (常數成本)標記路由蒸餾組裝集成組裝集成預訓練 Softmax ViTMLP 權重 (算子無關)Softmax 注意力 (特定)直接複製 MLP路由蒸餾注意力高效線性 ViT 成果

為什麼重要

本研究解決了高效率線性視覺模型難以重用既有大型預訓練模型權重的痛點。透過將「複製」與「蒸餾」低成本結合,開發者不需再從頭進行昂貴的高解析度或大規模預訓練,即可快速將傳統 ViT 轉化為適合邊緣運算或高解析度影像處理的高效線性模型,顯著降低了綠色 AI 與邊緣部署的門檻。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1邊緣設備與行動端部署:將大型 Softmax ViT 快速轉換為輕量高效的線性 ViT,並維持極高精度。
  2. 2高解析度影像任務:在大尺寸圖片處理中,利用線性複雜度降低記憶體開銷,並透過此初始化快速收斂。

限制與注意事項

  • 相較於純粹的權重複製,該方法仍需要額外的蒸餾訓練步驟,無法做到完全「零成本」轉換。
  • 模型的最終表現上限,仍會受到教師模型(原 Softmax ViT)本身特徵提取能力的限制。

延伸閱讀

MatLoom:用極簡程式空間實現分層式文字生成 PBR 材質
arXiv影像 AI

MatLoom:用極簡程式空間實現分層式文字生成 PBR 材質

MatLoom: Layered Text-to-Material Generation in a Compact Program Space

MatLoom 是一種用於文字生成材質的極簡程式語言,能驅使大語言模型直接生成可後續編輯的分層式 PBR 材質程式碼,並在提示詞對齊與視覺質感上超越傳統擴散模型。

2 分鐘閱讀