循環語言模型的「定點」重塑:邁向高效訓練、解碼與強化學習的全新架構
Towards Looped Models Done Right: Rethinking at Fixed Points for Efficient Training, Decoding, and RL
循環語言模型因重複呼叫網路層,每次循環都會增加訓練與推理成本。本研究發現,當循環狀態接近「定點」(Fixed Points)時,其演進路徑的影響會降低。研究團隊基於此特性改善了深度先驗與輸入注入:利用預測反饋配合熵項來學習深度先驗,並透過「正交輸入注入」消除輸入與狀態間的干涉。在 100M 至 1.6B 參數實驗中,新方法顯著降低了困惑度。此外,它實現了終端 KV 共享(減少 3 倍快取)、Prefill 速度提升 1.79 倍,且強化學習梯度計算速度翻倍。
核心重點
定點特性簡化運算路徑
當循環狀態接近定點時,到達定點的路徑重要性降低。這使得我們能使用截斷反向傳播,並在解碼時進行終端 KV 共享而幾乎不失真。
反饋引導的學習深度先驗
改進傳統固定深度與 Huginn 寬深度先驗的缺點,從預測反饋中學習先驗,並引入熵正則化項以保持其寬度,避免監督稀釋。
正交輸入注入防止抵消
傳統注入會使狀態的輸入分量放大或抵消注入。新方法透過正交化消除此分量,確保輸入注入的穩定性。
強化學習與 Prefill 大幅加速
利用定點特性直接從儲存的 Rollout 狀態計算 RL 梯度,使速度提升 2 倍;經蒸餾的學生模型可將 Prefill 速度提升 1.79 倍。
為什麼重要
這項研究克服了循環語言模型在 KV Cache 膨脹、Prefill 緩慢及強化學習反向傳播困難等關鍵痛點。在 1.6B 參數規模下,新方法僅需傳統固定深度訓練 1/3 的 KV Cache,即可達到相同的下游任務平均表現。這為在資源受限的邊緣裝置或高吞吐量伺服器上,部署低記憶體占用的高效 LLM 鋪平了道路。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
可以怎麼使用
- 1邊緣裝置高效部署:以 1/3 的 KV Cache 記憶體佔用運行 1.6B 級別的循環語言模型。
- 2低延遲問答系統:利用蒸餾學生模型將 Prefill 階段提速 1.79 倍,大幅降低首字輸出延遲(TTFT)。
- 3高效強化學習對齊:在 RLHF 訓練中,直接從 Rollout 狀態計算梯度,使訓練速度提升 2 倍。
限制與注意事項
- 定點收斂與先驗學習機制較為複雜,訓練時需要更細緻的超參數調優。
- 目前最大實驗規模為 1.6B 參數,在超大型模型(如 70B+)上的擴展性與穩定性仍有待實證。
延伸閱讀

解鎖阿聯酋方言與文化:專為在地語境打造的 Falcon-Emirati-7B 模型
Falcon-Emirati-7B: Bridging the Gap in Emirati Arabic Dialect and Culture
Falcon-Emirati-7B 是專為阿聯酋阿拉伯語設計的 7B 參數模型,克服了傳統 LLM 僅懂標準阿拉伯語的限制,精準掌握在地方言、詩歌與文化脈絡。

Google 推出 EmbeddingGemma 2:超輕量 740M 參數,讓裝置端擁有強大「多模態語意搜尋」與即時決策力
Google Launches EmbeddingGemma 2: Compact 740M Parameter Multimodal Embedding Model for Ultra-Low Latency Edge AI
Google 推出開源多模態嵌入模型 EmbeddingGemma 2,僅 740M 參數,能在手機和電腦上將文字、影像、影片與音訊映射至單一向量空間,實現極低延遲的裝置端隱私搜尋與即時決策。
基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力
Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens
最新研究指出,只要強制基礎模型以特定 token(如 'Okay')開頭,就能使其推理能力逼近經過強化學習(RL)微調的模型,並證實此現象源於訓練資料中的文本關聯。