自適應循環 Transformer 突破測試時縮放瓶頸:清華團隊提出 TaH2 架構
Overcoming Test-Time Scaling Bottlenecks with Adaptive Looped Transformers: Introducing TaH2
循環 Transformer 透過重複使用網路層來提高參數效率。然而,傳統方法對所有 token 進行相同次數的循環迭代,導致在相同計算量下表現反而不如非循環基準模型。為解決此痛點,研究團隊推出 TaH2。TaH2 在後訓練階段聯合訓練模型骨幹與一個「迭代決策器」,利用線上標籤評估進一步迭代是否能改善預測。在 challenging 的 AIME 數學基準測試中,TaH2 的「準確度-計算量」縮放斜率比基準模型提升了 53%,並在相同計算量下超越基準模型 3.4 個百分點。
核心重點
自適應 Token 迭代
TaH2 不再對所有 token 進行固定次數的循環,而是將額外的計算資源精準集中在能從中受益的難題 token 上。
前瞻深度監督技術
透過聯合訓練骨幹網路與「迭代決策器」,利用線上標籤即時判斷繼續迭代是否能真正提升預測準確度。
顯著提升縮放斜率
在 AIME 基準測試中,TaH2 的「準確度-計算量」斜率相較於非循環基準提升了 53%(2.74 對比 1.79)。
突破性能飽和限制
傳統循環模型增加深度時性能易陷入停滯,而 TaH2 的領先優勢隨最大迭代深度增加而持續擴大,從深度 2 的 +2.8 分提升到深度 8 的 +3.9 分。
技術圖解
| 非循環基準模型 (Non-Looped Baseline) | 現有循環模型 (Existing Looped) | TaH2 (自適應循環) | |
|---|---|---|---|
| 計算資源分配方式 | 靜態 / Token 均等 | 靜態 / Token 均等(在簡單 token 上浪費算力) | 動態 / Token 自適應(依難易度分配算力) |
| AIME 縮放斜率 (斜率越高越好) | 1.79 | 斜率較陡,但在相同計算量下表現較差 | 2.74 (提升 53%) |
| 隨深度增加之表現 | 標準基準表現 | 趨於平緩、增長飽和 | 持續增長(深度 8 時領先 3.9 分) |
為什麼重要
隨著大型語言模型在推理階段對「測試時縮放」(Test-Time Scaling)與思考時間的需求激增,如何在不浪費計算資源的情況下分配推理算力成為核心挑戰。TaH2 證明了透過「動態自適應深度」,循環 Transformer 能在相同的計算預算下實現遠超傳統模型的準確度。這為未來類似 OpenAI o1 等推理模型提供了極具參數與計算效率的優化路徑。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
可以怎麼使用
- 1複雜推理任務加速
- 2端側與邊緣設備部署
限制與注意事項
- 後訓練複雜度增加
- 動態批處理(Batching)硬體挑戰
延伸閱讀

艾倫人工智慧研究所開源 AstaBrief:比 Claude 快 3.5 倍的 8B 科學報告生成模型
Ai2 Open-Sources AstaBrief: An 8B Scientific Report Generator 3.5x Faster than Claude
艾倫人工智慧研究所(Ai2)開源 AstaBrief 8B 模型,專為科學文獻合成設計,透過單次寫作技術,在維持高引用精準度的同時,將報告生成速度提升 3.5 倍。
GALA:用線性混合變形蒸餾技術實現 3D Gaussian 虛擬化身即時動畫
GALA: Distilling 3D Gaussian Avatars into Linear Blendshapes for Real-Time Animation
本研究提出 GALA 方法,將預訓練 3D Gaussian 虛擬化身複雜的神經解碼蒸餾為輕量化線性 blendshape,在維持渲染品質的同時,將 CPU 動畫運算成本降低高達三個數量級,並在行動裝置上實現 60fps 即時動畫。
ScholarCatalyst:評估 AI 是否擁有「科學家直覺」的學術文獻檢索基準
ScholarCatalyst: A Benchmark for Testing AI's Intuition in Retrieving Inspiring Research Papers
ScholarCatalyst 是一個新型評估基準,由 184 位電腦科學論文作者親自標記啟發其研究的先前文獻,測試 AI 能否在專案初期僅憑初步構想,精準檢索出關鍵的靈感來源。