arXivAI 研究
探索與優化解耦:全新強化學習框架 ExpDis 提升大語言模型的推理多元性
Decoupling Exploration from Optimization: How ExpDis Boosts LLM Reasoning and Solution Diversity
本研究提出 ExpDis 框架,將強化學習中的「探索」與「優化」解耦。透過訓練帶有新穎性獎勵的探索者模型,篩選正確解法並蒸餾至學生模型,解決了傳統 RLVR 因過度探索導致模型退化的難題。
2 分鐘閱讀
#expdis
1 篇文章
Decoupling Exploration from Optimization: How ExpDis Boosts LLM Reasoning and Solution Diversity
本研究提出 ExpDis 框架,將強化學習中的「探索」與「優化」解耦。透過訓練帶有新穎性獎勵的探索者模型,篩選正確解法並蒸餾至學生模型,解決了傳統 RLVR 因過度探索導致模型退化的難題。