arXiv影像 AI
複製相同、蒸餾相異:為線性視覺 Transformer 注入預訓練威力的全新初始化策略
Copy the Same, Distill the Difference: A Smart Initialization Paradigm for Linear Vision Transformers
本研究提出 CSDD 初始化框架,透過直接複製「算子無關」的 MLP 權重並蒸餾「算子特定」的注意力路由行為,成功讓線性視覺 Transformer(Linear ViT)無縫繼承 Softmax 預訓練模型的效能。
2 分鐘閱讀