FERPO:免除動作梯度的前向熵正規化策略最佳化,實現高效且穩定的強化學習
FERPO: Forward Entropy-Regularized Policy Optimization Without Action Gradients
在連續控制的強化學習中,傳統方法常利用評論家(critic)網路的動作梯度來更新策略,但準確的價值預估並不代表動作求導同樣可靠,易導致更新不穩定。為解決此痛點,研究團隊提出 FERPO。它利用熵與 KL 散度正規化推導出目標動作分佈,並以「前向 KL 散度」配合自標準化重要性採樣(SNIS)來擬合行動者(actor)。此舉不僅避開了不可靠的梯度計算,更藉由前向 KL 鼓勵覆蓋多個高價值模態以促進探索,在 MuJoCo 與 ManiSkill 基準測試中展現出頂尖的效率與更新速度。
核心重點
免除動作梯度計算
直接利用評論家的預測價值進行策略改善,無需對動作進行微分,從根本上避免了不準確導數帶來的策略更新波動。
前向 KL 散度促進探索
相較於容易陷入單一最優解的逆向 KL 散度,前向 KL 散度能主動覆蓋多個高價值模態,顯著提升探索成效。
穩健的自標準化重要性採樣
藉由 KL 正規化限制目標分佈與 rollout 策略間的偏差,確保自標準化重要性採樣(SNIS)的權重保持穩定。
更快的運算與高效率
在 MuJoCo Playground 與 ManiSkill 實驗中,表現出卓越的樣本效率,且行動者更新速度明顯超越 REPPO 演算法。
技術圖解
| 標準梯度型方法 (Gradient-Based) | REPPO 演算法 | FERPO (本研究) | |
|---|---|---|---|
| 評論家求導需求 | 需要 (容易因微分誤差而不穩定) | 需要 (計算 Pathwise 梯度) | 不需要 (僅使用數值,更新極穩定) |
| 優化目標函數 | 逆向 KL 或直接策略梯度 | 逆向 KL 正規化 | 前向 KL 正規化與 SNIS 估計 |
| 探索機制與模態覆蓋 | 傾向於單一模態 (容易陷入局部最優) | 傾向於單一模態 (Mode-seeking) | 可覆蓋多個高價值模態 (Mode-covering) |
| 計算速度與效率 | 標準 | 較慢 (因 Pathwise 梯度計算開銷大) | 極快 (Actor 更新開銷大幅減少) |
為什麼重要
在機器人操控等連續控制領域中,強化學習的更新穩定性一直飽受評論家梯度誤差的困擾。FERPO 提出了一個無需對評論家求導的優雅解決方案。它不僅透過前向 KL 散度本質上改善了多模態探索、防止策略崩潰,更在模擬基準測試中證明了其高樣本效率與低運算開銷,為建立更穩健、更快速的實體機器人控制策略訓練帶來全新啟發。
對誰有影響
- AI 研究人員
- AI 開發者
- 學生與學習者
可以怎麼使用
- 1機器人手臂操控(如 ManiSkill 環境中的高精度物件抓取與裝配)
- 2多足與雙足機器人的複雜地形步態控制與運動規劃
- 3高樣本效率的在線強化學習模擬與快速原型開發
限制與注意事項
- 本演算法屬於在線(on-policy)框架,其資料利用率在特定離線(off-policy)場景中可能仍受限。
- 若目標分佈與當前 rollout 策略偏離過大,SNIS 仍可能面臨重要性權重變異數過大的潛在風險。
延伸閱讀

艾倫人工智慧研究所開源 AstaBrief:比 Claude 快 3.5 倍的 8B 科學報告生成模型
Ai2 Open-Sources AstaBrief: An 8B Scientific Report Generator 3.5x Faster than Claude
艾倫人工智慧研究所(Ai2)開源 AstaBrief 8B 模型,專為科學文獻合成設計,透過單次寫作技術,在維持高引用精準度的同時,將報告生成速度提升 3.5 倍。
GALA:用線性混合變形蒸餾技術實現 3D Gaussian 虛擬化身即時動畫
GALA: Distilling 3D Gaussian Avatars into Linear Blendshapes for Real-Time Animation
本研究提出 GALA 方法,將預訓練 3D Gaussian 虛擬化身複雜的神經解碼蒸餾為輕量化線性 blendshape,在維持渲染品質的同時,將 CPU 動畫運算成本降低高達三個數量級,並在行動裝置上實現 60fps 即時動畫。
ScholarCatalyst:評估 AI 是否擁有「科學家直覺」的學術文獻檢索基準
ScholarCatalyst: A Benchmark for Testing AI's Intuition in Retrieving Inspiring Research Papers
ScholarCatalyst 是一個新型評估基準,由 184 位電腦科學論文作者親自標記啟發其研究的先前文獻,測試 AI 能否在專案初期僅憑初步構想,精準檢索出關鍵的靈感來源。