SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability
在可驗證獎勵的強化學習(RLVR)中,傳統的 GRPO 演算法會將相同的優勢值平均分配給回覆中的所有 Token,這容易錯誤強化與推理無關的提示特徵。為了改善此一缺點,研究團隊提出 SCAPO(半事實信用增強策略最佳化)。該方法藉由「半事實提示干預」(即改變無關問題答案的提示詞特徵)來測量 Token 的機率漂移,並在早期訓練中調降不穩定 Token 的信用權重。實驗證實,SCAPO 成功降低了模型對提示詞的敏感度,並在 Qwen3 基準模型上大幅提升了數學任務的準確度。
核心重點
GRPO 粗粒度信用分配的缺陷
傳統 GRPO 給予同一生成回覆中所有 Token 相同的優勢度,容易強化對無關提示特徵的偽依賴。
引入半事實干預與機率漂移
SCAPO 透過改變提示詞中與問題及答案無關的修飾語,觀察相同回覆在不同提示詞下的 Token 機率變化。
精準調降不穩定 Token 的信用
在訓練早期利用歸一化後的穩定性分數,調降高漂移 Token 的優勢值,且不因穩定而額外給予獎勵。
顯著提升數學推理與 OOD 泛化
在 Qwen3-4B 和 1.7B 模型上,AIME 準確度分別提升 5.63 與 4.17 個百分點,並在所有 OOD 基準測試中取得最佳表現。
技術圖解
為什麼重要
在強化學習訓練推理模型時,常見的問題是「模型雖然給出正確答案,卻依賴錯誤或不相關的提示詞特徵」。SCAPO 提供了一種細粒度且具備因果啟發的 Token 級別信用分配機制。這不僅能大幅減少模型對「提示工程(Prompt Engineering)」的過度敏感度,更能有效提升模型在面對未曾見過的分配外(OOD)問題時的真實邏輯與推理泛化能力。
對誰有影響
- AI 研究人員
- AI 開發者
可以怎麼使用
- 1推理型 LLM 的強化學習對齊與訓練
- 2降低模型對於特定提示格式或模板的敏感度
限制與注意事項
- 需要針對提示詞設計半事實干預變體,可能增加前期的資料設計與運算開銷。
- 核心機制主要針對具備明確、可自動驗證獎勵(Verifiable Rewards)的推理任務。
延伸閱讀
STEPQuant:空間與時間雙重優化,突破線性注意力循環狀態量化瓶頸
STEPQuant: Spatial-Temporal Quantization for Linear Attention Recurrent States
本研究提出 STEPQuant 框架,針對線性注意力模型中的循環狀態進行空間與時間維度的後訓練量化,在 6-bit 預算下幾乎無損保留精度,並減少高達 68.7% 的伺服記憶體開銷。
LeapQuant:突破線性注意力瓶頸,實現近乎無損的 8-bit 遞迴狀態量化
LeapQuant: Near-Lossless 8-Bit Recurrent State Quantization for Linear Attention LLMs
LeapQuant 是一種無需訓練的量化方法,透過「逐視窗量化」與「補償 Token」技術,解決線性注意力模型中遞迴狀態量化造成的精度損失,在保持 FP32 級精度的同時,實現高達 1.47 倍的端到端推論加速。
微型顧問的逆襲:AdviSD 透過目標多輪自我蒸餾精準引導前沿大模型
AdviSD: Steering Frontier LLMs via Targeted Multi-Turn Self-Distillation
AdviSD 框架讓小型、可訓練的顧問模型(如 Qwen3-8B)透過自然語言建議引導強大的凍結執行模型(如 Gemini、Claude),並運用選擇性自我蒸餾篩選出最具影響力的修正決策,大幅提升工具調用與任務表現。