arXivAI 研究
規劃學習:以 Horizon Loss 橋接交叉熵與策略梯度的全新損失函數
Planning to Learn: Bridging Cross-Entropy and Policy Gradient with Horizon Loss
本研究指出傳統精確策略梯度因缺乏遠見而輸給交叉熵,並提出 Horizon Loss(地平線損失),透過動態縮短學習地平線,在 ImageNet 基準測試中成功超越交叉熵。
2 分鐘閱讀
#cross-entropy
1 篇文章
Planning to Learn: Bridging Cross-Entropy and Policy Gradient with Horizon Loss
本研究指出傳統精確策略梯度因缺乏遠見而輸給交叉熵,並提出 Horizon Loss(地平線損失),透過動態縮短學習地平線,在 ImageNet 基準測試中成功超越交叉熵。