Aivora

#scapo

SCAPO

1 篇文章

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
arXiv大型語言模型

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配

SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability

本研究提出 SCAPO 演算法,藉由半事實提示干預衡量 Token 的穩定性,精準調整強化學習中的信用分配,顯著提升了大型語言模型的數學推理與泛化能力。

2 分鐘閱讀