Aivora

#scapo

SCAPO

1 article

SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability
arXivLLM

SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配

SCAPO is a novel variant of GRPO that incorporates semifactual stability into token-level credit assignment, significantly improving LLM reasoning accuracy and out-of-distribution generalization.

2 min read