Aivora
arXiv大型語言模型專業

循環語言模型的「定點」重塑:邁向高效訓練、解碼與強化學習的全新架構

Towards Looped Models Done Right: Rethinking at Fixed Points for Efficient Training, Decoding, and RL

2 分鐘閱讀
循環語言模型的「定點」重塑:邁向高效訓練、解碼與強化學習的全新架構
30 秒看懂

循環語言模型因重複呼叫網路層,每次循環都會增加訓練與推理成本。本研究發現,當循環狀態接近「定點」(Fixed Points)時,其演進路徑的影響會降低。研究團隊基於此特性改善了深度先驗與輸入注入:利用預測反饋配合熵項來學習深度先驗,並透過「正交輸入注入」消除輸入與狀態間的干涉。在 100M 至 1.6B 參數實驗中,新方法顯著降低了困惑度。此外,它實現了終端 KV 共享(減少 3 倍快取)、Prefill 速度提升 1.79 倍,且強化學習梯度計算速度翻倍。

核心重點

01

定點特性簡化運算路徑

當循環狀態接近定點時,到達定點的路徑重要性降低。這使得我們能使用截斷反向傳播,並在解碼時進行終端 KV 共享而幾乎不失真。

02

反饋引導的學習深度先驗

改進傳統固定深度與 Huginn 寬深度先驗的缺點,從預測反饋中學習先驗,並引入熵正則化項以保持其寬度,避免監督稀釋。

03

正交輸入注入防止抵消

傳統注入會使狀態的輸入分量放大或抵消注入。新方法透過正交化消除此分量,確保輸入注入的穩定性。

04

強化學習與 Prefill 大幅加速

利用定點特性直接從儲存的 Rollout 狀態計算 RL 梯度,使速度提升 2 倍;經蒸餾的學生模型可將 Prefill 速度提升 1.79 倍。

為什麼重要

這項研究克服了循環語言模型在 KV Cache 膨脹、Prefill 緩慢及強化學習反向傳播困難等關鍵痛點。在 1.6B 參數規模下,新方法僅需傳統固定深度訓練 1/3 的 KV Cache,即可達到相同的下游任務平均表現。這為在資源受限的邊緣裝置或高吞吐量伺服器上,部署低記憶體占用的高效 LLM 鋪平了道路。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1邊緣裝置高效部署:以 1/3 的 KV Cache 記憶體佔用運行 1.6B 級別的循環語言模型。
  2. 2低延遲問答系統:利用蒸餾學生模型將 Prefill 階段提速 1.79 倍,大幅降低首字輸出延遲(TTFT)。
  3. 3高效強化學習對齊:在 RLHF 訓練中,直接從 Rollout 狀態計算梯度,使訓練速度提升 2 倍。

限制與注意事項

  • 定點收斂與先驗學習機制較為複雜,訓練時需要更細緻的超參數調優。
  • 目前最大實驗規模為 1.6B 參數,在超大型模型(如 70B+)上的擴展性與穩定性仍有待實證。

延伸閱讀

Google 推出 EmbeddingGemma 2:超輕量 740M 參數,讓裝置端擁有強大「多模態語意搜尋」與即時決策力
Google AI Developers大型語言模型

Google 推出 EmbeddingGemma 2:超輕量 740M 參數,讓裝置端擁有強大「多模態語意搜尋」與即時決策力

Google Launches EmbeddingGemma 2: Compact 740M Parameter Multimodal Embedding Model for Ultra-Low Latency Edge AI

Google 推出開源多模態嵌入模型 EmbeddingGemma 2,僅 740M 參數,能在手機和電腦上將文字、影像、影片與音訊映射至單一向量空間,實現極低延遲的裝置端隱私搜尋與即時決策。

2 分鐘閱讀
基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力
arXiv大型語言模型

基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力

Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens

最新研究指出,只要強制基礎模型以特定 token(如 'Okay')開頭,就能使其推理能力逼近經過強化學習(RL)微調的模型,並證實此現象源於訓練資料中的文本關聯。

2 分鐘閱讀