arXivAI Research
Planning to Learn: Bridging Cross-Entropy and Policy Gradient with Horizon Loss
規劃學習:以 Horizon Loss 橋接交叉熵與策略梯度的全新損失函數
This study explains why exact policy gradient loses to cross-entropy due to myopic updates, introducing 'horizon loss' to dynamically balance immediate rewards and future learning.
2 min read