arXiv大型語言模型
SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability
本研究提出 SCAPO 演算法,藉由半事實提示干預衡量 Token 的穩定性,精準調整強化學習中的信用分配,顯著提升了大型語言模型的數學推理與泛化能力。
2 分鐘閱讀
#scapo
1 篇文章
SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability
本研究提出 SCAPO 演算法,藉由半事實提示干預衡量 Token 的穩定性,精準調整強化學習中的信用分配,顯著提升了大型語言模型的數學推理與泛化能力。