規劃學習:以 Horizon Loss 橋接交叉熵與策略梯度的全新損失函數
Planning to Learn: Bridging Cross-Entropy and Policy Gradient with Horizon Loss
強化學習中的策略梯度法常用於 LLM 後訓練,但在分類任務中,精確的策略梯度(EPG)表現卻不如交叉熵(CE)。作者發現,EPG 具有「短視」缺點,僅評估當下更新的價值。而交叉熵則可被視為「無限地平線的耐心準確度」。為此,研究提出了「Horizon Loss(地平線損失)」,這是一行程式碼的極簡修改,能在訓練過程中,隨時間從交叉熵平滑過渡到 EPG。在 MNIST 與 ImageNet 實驗中,此方法顯著提升了分類準確度,且在標記雜訊較高時優勢更為明顯。
核心重點
揭示策略梯度的短視缺陷
精確策略梯度(EPG)在更新時只關注當下的即時回報,忽視了當前更新會如何影響未來學習的起點。
重新定義交叉熵為「耐心準確度」
交叉熵實質上代表了無限時間地平線下的總累積誤差,因此比 EPG 更具備前瞻性與長線規劃能力。
極簡實用的 Horizon Loss
僅需修改一行程式碼,將學習地平線截斷在「剩餘的訓練步數」,使訓練後期自然從交叉熵過渡至 EPG。
抗雜訊能力顯著提升
在 MNIST 及 ImageNet 基準測試中,Horizon Loss 提升了 ViT 與 ResNet 的準確度,且在標記雜訊增加時優勢更明顯。
技術圖解
| Cross-Entropy (CE) | Exact Policy Gradient (EPG) | Horizon Loss | |
|---|---|---|---|
| 學習地平線 | 無限地平線 (Infinite) | 零地平線 (Zero-horizon) | 動態遞減 (Decaying with training) |
| 最佳化特點 | 有耐心的長線學習 | 近視、僅關注當下回報 | 前期重長線,後期精準收斂 |
| 抗標記雜訊表現 | 一般 (Moderate) | 較差 (Poor) | 優異 (Superior) |
為什麼重要
這項研究為深度學習與強化學習(特別是 LLM 後訓練的 RL 階段)提供了全新的理論視角。它指出了現行策略梯度方法「缺乏遠見」的根本痛點,並透過極簡的數學修正(Horizon Loss),在不增加計算複雜度的前提下,顯著優化了模型在面對標記雜訊時的泛化能力與收斂品質。
對誰有影響
- AI 開發者
- AI 研究人員
可以怎麼使用
- 1深度學習影像分類模型訓練(如 ImageNet 上的 ResNet 與 ViT 訓練)
- 2處理富含大量標記雜訊(Label Noise)的現實世界資料集
- 3優化基於策略梯度的強化學習與大型語言模型後訓練對齊
限制與注意事項
- 實證測試目前主要集中於圖像分類任務,尚未在大型語言模型(LLM)的真實強化學習場景中進行完整驗證。
- 使用 Horizon Loss 時,需要動態估算或設定剩餘的訓練步驟(Horizon),在無限期或開放式訓練中應用可能較具挑戰性。
延伸閱讀
減少解碼器反而增強編碼器:從新視角合成中提煉強大三維幾何表徵
Less Decoder is More Encoder: Extracting Robust 3D Geometric Representations via Novel View Synthesis
本研究揭示了新視角合成模型(NVS)中解碼器過強會稀釋幾何表徵的弊端,並提出 SNAP 架構,透過限制解碼器與採用潛在空間重建,大幅提升編碼器的三維幾何學習能力。
4DCodeBench:評估 AI Agent 動態場景 4D 反向圖形學與程式碼生成能力的全新基準
4DCodeBench: Benchmarking AI Agents on 4D Inverse Graphics and Dynamic Scene Code Generation
4DCodeBench 是一個全新基準測試,旨在評估 AI Agent 藉由生成可執行物理繪圖程式,從影片中重建 4D 動態場景的能力。
世界模型該遺忘什麼?以「分層保留」實現持續適應環境的能力
What Should World Models Forget? Stratified Retention for Continual Adaptation
本研究指出世界模型在持續學習時不應一味避免遺忘,而須透過「分層保留」區分永恆不變的物理定律與需要隨環境即時更新的動態事實。