單一區塊實現多重深度:具備深度編程專家庫的循環 Vision Transformer
One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts
傳統 Vision Transformer (ViT) 仰賴堆疊多個獨立層,帶來龐大的模型儲存負擔。reViT 提出僅使用「單一」Transformer 區塊進行循環計算,並引入「深度編程專家庫」(Depth-Programmed Experts)。在每個循環深度,將前饋網路(FFN)表達為共享專家庫在權重空間上的凸組合,由連續的深度座標控制。實驗顯示,reViT-B/16 從頭訓練可達到 DeiT III 的精確度,但儲存參數減少約 70%;蒸餾自 DINOv2 的模型亦能完美轉移至分類、分割與深度預測任務。此外,模型支援彈性深度推論與靜態展平部署。
核心重點
單區塊循環架構
重複調用同一個 Transformer 區塊,大幅降低模型記憶體與參數量的儲存需求。
權重空間融合專家
將各深度的 FFN 表現為 shared expert 的權重凸組合,效果優於傳統 Token 路由與輸出混合機制。
參數量減少七成
reViT-B/16 在 ImageNet-1k 上可達到 DeiT III 的精確度,但僅需約 30% 的儲存參數量。
彈性深度與靜態部署
單一權重檢查點可彈性支援多種推理深度;固定深度部署時可預先融合權重以消除線上路由開銷。
技術圖解
為什麼重要
對於邊緣設備與資源受限的硬體環境,大型視覺 Transformer 的記憶體開銷常是落地瓶頸。reViT 證明了「循環區塊 + 權重空間動態融合」能在維持完整表達能力與相同 FLOPs 計算量的同時,將模型參數儲存體積壓縮數倍。此外,彈性深度訓練讓單一模型能依據即時算力靈活調整計算量,大幅提升視覺骨幹網路在多端部署時的實用性。
對誰有影響
- AI 研究人員
- AI 開發者
- 學生與學習者
- 企業決策者
可以怎麼使用
- 1記憶體受限的邊緣裝置與移動端視覺骨幹網路
- 2適應性算力推理(根據硬體負載動態切換計算深度)
- 3高效能蒸餾特徵提取器(應用於語意分割、物件偵測與深度預測)
限制與注意事項
- 推理計算量 (FLOPs) 與相同深度的標準 ViT 相當,主要節省的是參數儲存空間,而非計算時間
- 若在固定的傳統密集圖形上靜態展平部署,會失去權重壓縮的儲存優勢
延伸閱讀
重新審視 METR 時間跨度指標:以統計模型量化 AI 的真實任務能力
Re-Evaluating AI Time Horizons: A Statistical Assessment of the METR Benchmark
本研究利用樣條函數與項目反應理論重新分析 METR 資料集,發現 AI 處理任務的難度與人類時間對數非線性相關,突破 2 至 30 分鐘任務的難度遠低於從 30 分鐘跨越至 5 小時。
打造過目不忘的 3D 空間記憶:Ledger 如何透過第一人稱影片追蹤隱形物體
Building Persistent 3D Object Memory: How Ledger Tracks Objects from Egocentric Videos
普林斯頓等機構的研究人員提出 Ledger 框架,透過第一人稱視角影片為具身智慧助理建立持久的 3D 物體記憶,大幅提升空間定位與問答的準確度。
探索與優化解耦:全新強化學習框架 ExpDis 提升大語言模型的推理多元性
Decoupling Exploration from Optimization: How ExpDis Boosts LLM Reasoning and Solution Diversity
本研究提出 ExpDis 框架,將強化學習中的「探索」與「優化」解耦。透過訓練帶有新穎性獎勵的探索者模型,篩選正確解法並蒸餾至學生模型,解決了傳統 RLVR 因過度探索導致模型退化的難題。