Aivora
arXivAI 研究進階

單一區塊實現多重深度:具備深度編程專家庫的循環 Vision Transformer

One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts

2 分鐘閱讀
單一區塊實現多重深度:具備深度編程專家庫的循環 Vision Transformer
30 秒看懂

傳統 Vision Transformer (ViT) 仰賴堆疊多個獨立層,帶來龐大的模型儲存負擔。reViT 提出僅使用「單一」Transformer 區塊進行循環計算,並引入「深度編程專家庫」(Depth-Programmed Experts)。在每個循環深度,將前饋網路(FFN)表達為共享專家庫在權重空間上的凸組合,由連續的深度座標控制。實驗顯示,reViT-B/16 從頭訓練可達到 DeiT III 的精確度,但儲存參數減少約 70%;蒸餾自 DINOv2 的模型亦能完美轉移至分類、分割與深度預測任務。此外,模型支援彈性深度推論與靜態展平部署。

核心重點

01

單區塊循環架構

重複調用同一個 Transformer 區塊,大幅降低模型記憶體與參數量的儲存需求。

02

權重空間融合專家

將各深度的 FFN 表現為 shared expert 的權重凸組合,效果優於傳統 Token 路由與輸出混合機制。

03

參數量減少七成

reViT-B/16 在 ImageNet-1k 上可達到 DeiT III 的精確度,但僅需約 30% 的儲存參數量。

04

彈性深度與靜態部署

單一權重檢查點可彈性支援多種推理深度;固定深度部署時可預先融合權重以消除線上路由開銷。

技術圖解

reViT 循環區塊與深度編程專家運作機制
座標編程軌跡提供專家權重生成該深度 FFN循環傳入特徵下一深度循環 (t+1)完成指定深度計算正規化深度座標 t共享專家庫權重空間凸組合單一 Transformer 區塊輸入影像特徵最終特徵輸出

為什麼重要

對於邊緣設備與資源受限的硬體環境,大型視覺 Transformer 的記憶體開銷常是落地瓶頸。reViT 證明了「循環區塊 + 權重空間動態融合」能在維持完整表達能力與相同 FLOPs 計算量的同時,將模型參數儲存體積壓縮數倍。此外,彈性深度訓練讓單一模型能依據即時算力靈活調整計算量,大幅提升視覺骨幹網路在多端部署時的實用性。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 學生與學習者
  • 企業決策者

可以怎麼使用

  1. 1記憶體受限的邊緣裝置與移動端視覺骨幹網路
  2. 2適應性算力推理(根據硬體負載動態切換計算深度)
  3. 3高效能蒸餾特徵提取器(應用於語意分割、物件偵測與深度預測)

限制與注意事項

  • 推理計算量 (FLOPs) 與相同深度的標準 ViT 相當,主要節省的是參數儲存空間,而非計算時間
  • 若在固定的傳統密集圖形上靜態展平部署,會失去權重壓縮的儲存優勢

延伸閱讀

重新審視 METR 時間跨度指標:以統計模型量化 AI 的真實任務能力
arXivAI 研究

重新審視 METR 時間跨度指標:以統計模型量化 AI 的真實任務能力

Re-Evaluating AI Time Horizons: A Statistical Assessment of the METR Benchmark

本研究利用樣條函數與項目反應理論重新分析 METR 資料集,發現 AI 處理任務的難度與人類時間對數非線性相關,突破 2 至 30 分鐘任務的難度遠低於從 30 分鐘跨越至 5 小時。

2 分鐘閱讀
探索與優化解耦:全新強化學習框架 ExpDis 提升大語言模型的推理多元性
arXivAI 研究

探索與優化解耦:全新強化學習框架 ExpDis 提升大語言模型的推理多元性

Decoupling Exploration from Optimization: How ExpDis Boosts LLM Reasoning and Solution Diversity

本研究提出 ExpDis 框架,將強化學習中的「探索」與「優化」解耦。透過訓練帶有新穎性獎勵的探索者模型,篩選正確解法並蒸餾至學生模型,解決了傳統 RLVR 因過度探索導致模型退化的難題。

2 分鐘閱讀