Aivora
arXivAI 研究專業

自適應循環 Transformer 突破測試時縮放瓶頸:清華團隊提出 TaH2 架構

Overcoming Test-Time Scaling Bottlenecks with Adaptive Looped Transformers: Introducing TaH2

2 分鐘閱讀
自適應循環 Transformer 突破測試時縮放瓶頸:清華團隊提出 TaH2 架構
30 秒看懂

循環 Transformer 透過重複使用網路層來提高參數效率。然而,傳統方法對所有 token 進行相同次數的循環迭代,導致在相同計算量下表現反而不如非循環基準模型。為解決此痛點,研究團隊推出 TaH2。TaH2 在後訓練階段聯合訓練模型骨幹與一個「迭代決策器」,利用線上標籤評估進一步迭代是否能改善預測。在 challenging 的 AIME 數學基準測試中,TaH2 的「準確度-計算量」縮放斜率比基準模型提升了 53%,並在相同計算量下超越基準模型 3.4 個百分點。

核心重點

01

自適應 Token 迭代

TaH2 不再對所有 token 進行固定次數的循環,而是將額外的計算資源精準集中在能從中受益的難題 token 上。

02

前瞻深度監督技術

透過聯合訓練骨幹網路與「迭代決策器」,利用線上標籤即時判斷繼續迭代是否能真正提升預測準確度。

03

顯著提升縮放斜率

在 AIME 基準測試中,TaH2 的「準確度-計算量」斜率相較於非循環基準提升了 53%(2.74 對比 1.79)。

04

突破性能飽和限制

傳統循環模型增加深度時性能易陷入停滯,而 TaH2 的領先優勢隨最大迭代深度增加而持續擴大,從深度 2 的 +2.8 分提升到深度 8 的 +3.9 分。

技術圖解

TaH2 與傳統模型的架構與效能對比
非循環基準模型 (Non-Looped Baseline)現有循環模型 (Existing Looped)TaH2 (自適應循環)
計算資源分配方式靜態 / Token 均等靜態 / Token 均等(在簡單 token 上浪費算力)動態 / Token 自適應(依難易度分配算力)
AIME 縮放斜率 (斜率越高越好)1.79斜率較陡,但在相同計算量下表現較差2.74 (提升 53%)
隨深度增加之表現標準基準表現趨於平緩、增長飽和持續增長(深度 8 時領先 3.9 分)

為什麼重要

隨著大型語言模型在推理階段對「測試時縮放」(Test-Time Scaling)與思考時間的需求激增,如何在不浪費計算資源的情況下分配推理算力成為核心挑戰。TaH2 證明了透過「動態自適應深度」,循環 Transformer 能在相同的計算預算下實現遠超傳統模型的準確度。這為未來類似 OpenAI o1 等推理模型提供了極具參數與計算效率的優化路徑。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1複雜推理任務加速
  2. 2端側與邊緣設備部署

限制與注意事項

  • 後訓練複雜度增加
  • 動態批處理(Batching)硬體挑戰

延伸閱讀

GALA:用線性混合變形蒸餾技術實現 3D Gaussian 虛擬化身即時動畫
arXivAI 研究

GALA:用線性混合變形蒸餾技術實現 3D Gaussian 虛擬化身即時動畫

GALA: Distilling 3D Gaussian Avatars into Linear Blendshapes for Real-Time Animation

本研究提出 GALA 方法,將預訓練 3D Gaussian 虛擬化身複雜的神經解碼蒸餾為輕量化線性 blendshape,在維持渲染品質的同時,將 CPU 動畫運算成本降低高達三個數量級,並在行動裝置上實現 60fps 即時動畫。

2 分鐘閱讀
ScholarCatalyst:評估 AI 是否擁有「科學家直覺」的學術文獻檢索基準
arXivAI 研究

ScholarCatalyst:評估 AI 是否擁有「科學家直覺」的學術文獻檢索基準

ScholarCatalyst: A Benchmark for Testing AI's Intuition in Retrieving Inspiring Research Papers

ScholarCatalyst 是一個新型評估基準,由 184 位電腦科學論文作者親自標記啟發其研究的先前文獻,測試 AI 能否在專案初期僅憑初步構想,精準檢索出關鍵的靈感來源。

2 分鐘閱讀