探索與優化解耦:全新強化學習框架 ExpDis 提升大語言模型的推理多元性
Decoupling Exploration from Optimization: How ExpDis Boosts LLM Reasoning and Solution Diversity
在具可驗證獎勵的強化學習(RLVR)中,引導大語言模型(LLM)探索新穎推理策略常會導致模型性能退化。為解決此問題,研究團隊推出「探索-蒸餾」(ExpDis)框架,將探索與優化兩階段完全解耦。該方法先訓練帶有新穎性獎勵的「探索者策略」以搜集多樣解法,經過濾後,再將正確且高質量的軌跡蒸餾至不帶新穎性獎勵的「學生策略」中。實驗顯示,ExpDis 在 7 個數學推理基準測試中皆優於 DAPO,並顯著提升了 pass@k 表現。
核心重點
解耦探索與優化
將尋找新解法的「探索」與穩定提升性能的「優化」拆分為獨立階段,避免強烈的新穎性獎勵破壞模型基本能力。
探索-蒸餾雙階段迭代
以新穎性獎勵訓練探索者,過濾出正確且高質量的解答軌跡後,再蒸餾至不含新穎性偏見的學生模型中。
更優異的解法多樣性
在相同時間預算下,ExpDis 在 7 個數學推理測試中皆超越 DAPO,且展現出更佳的 pass@k 擴展性,能生成更多樣的正確解法。
技術圖解
為什麼重要
在訓練推理型 LLM 時,如何在激勵模型「跳脫框架思考」的同時保持其回答的穩定與準確,一直是強化學習的痛點。ExpDis 證明了「探索」與「學習」分離的巨大價值。這對於科學、數學和程式碼等具有客觀驗證標準(verifiable rewards)的領域至關重要,能幫助 AI 發現人類未曾教授的全新推理路徑,同時確保模型不失控退化。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
可以怎麼使用
- 1數學推理與多元解題:訓練 LLM 針對複雜數學問題產生多種不同的正確證明與解題步驟。
- 2程式碼生成與演算法探索:在程式合成中探索多種演算法實現方式,並蒸餾出最優雅高效的程式碼。
限制與注意事項
- 本方法主要在數學推理等具有明確客觀驗證獎勵(verifiable rewards)的任務上評估,在主觀或非結構化任務中的成效仍待驗證。
- 多輪交替的探索與蒸餾訓練流程會增加整體系統的工程複雜度與管線維護成本。
延伸閱讀
打造過目不忘的 3D 空間記憶:Ledger 如何透過第一人稱影片追蹤隱形物體
Building Persistent 3D Object Memory: How Ledger Tracks Objects from Egocentric Videos
普林斯頓等機構的研究人員提出 Ledger 框架,透過第一人稱視角影片為具身智慧助理建立持久的 3D 物體記憶,大幅提升空間定位與問答的準確度。
符合性預測集合如何量化資訊增益:資訊理論的新視角
How Conformal Prediction Sets Quantify Information Gain: An Information-Theoretic Foundation
本研究為「符合性預測(Conformal Prediction)的集合大小可作為不確定性量度」奠定了資訊理論基礎,證明其與香農互資訊的內在聯繫。
4D-HOF:利用流匹配技術實現前饋式 4D 手部與物體互動重建
4D-HOF: Feed-Forward 4D Hand-Object Interaction Reconstruction via Flow Matching
4D-HOF 是一個前饋式框架,利用條件流匹配技術將視覺基礎模型產生的粗糙手物狀態,轉換並修正為符合物理與幾何約束的精確 4D 互動重建。