Aivora
arXivAI 研究專業

規劃學習:以 Horizon Loss 橋接交叉熵與策略梯度的全新損失函數

Planning to Learn: Bridging Cross-Entropy and Policy Gradient with Horizon Loss

2 分鐘閱讀
規劃學習:以 Horizon Loss 橋接交叉熵與策略梯度的全新損失函數
30 秒看懂

強化學習中的策略梯度法常用於 LLM 後訓練,但在分類任務中,精確的策略梯度(EPG)表現卻不如交叉熵(CE)。作者發現,EPG 具有「短視」缺點,僅評估當下更新的價值。而交叉熵則可被視為「無限地平線的耐心準確度」。為此,研究提出了「Horizon Loss(地平線損失)」,這是一行程式碼的極簡修改,能在訓練過程中,隨時間從交叉熵平滑過渡到 EPG。在 MNIST 與 ImageNet 實驗中,此方法顯著提升了分類準確度,且在標記雜訊較高時優勢更為明顯。

核心重點

01

揭示策略梯度的短視缺陷

精確策略梯度(EPG)在更新時只關注當下的即時回報,忽視了當前更新會如何影響未來學習的起點。

02

重新定義交叉熵為「耐心準確度」

交叉熵實質上代表了無限時間地平線下的總累積誤差,因此比 EPG 更具備前瞻性與長線規劃能力。

03

極簡實用的 Horizon Loss

僅需修改一行程式碼,將學習地平線截斷在「剩餘的訓練步數」,使訓練後期自然從交叉熵過渡至 EPG。

04

抗雜訊能力顯著提升

在 MNIST 及 ImageNet 基準測試中,Horizon Loss 提升了 ViT 與 ResNet 的準確度,且在標記雜訊增加時優勢更明顯。

技術圖解

交叉熵、精確策略梯度與 Horizon Loss 比較
Cross-Entropy (CE)Exact Policy Gradient (EPG)Horizon Loss
學習地平線無限地平線 (Infinite)零地平線 (Zero-horizon)動態遞減 (Decaying with training)
最佳化特點有耐心的長線學習近視、僅關注當下回報前期重長線,後期精準收斂
抗標記雜訊表現一般 (Moderate)較差 (Poor)優異 (Superior)

為什麼重要

這項研究為深度學習與強化學習(特別是 LLM 後訓練的 RL 階段)提供了全新的理論視角。它指出了現行策略梯度方法「缺乏遠見」的根本痛點,並透過極簡的數學修正(Horizon Loss),在不增加計算複雜度的前提下,顯著優化了模型在面對標記雜訊時的泛化能力與收斂品質。

對誰有影響

  • AI 開發者
  • AI 研究人員

可以怎麼使用

  1. 1深度學習影像分類模型訓練(如 ImageNet 上的 ResNet 與 ViT 訓練)
  2. 2處理富含大量標記雜訊(Label Noise)的現實世界資料集
  3. 3優化基於策略梯度的強化學習與大型語言模型後訓練對齊

限制與注意事項

  • 實證測試目前主要集中於圖像分類任務,尚未在大型語言模型(LLM)的真實強化學習場景中進行完整驗證。
  • 使用 Horizon Loss 時,需要動態估算或設定剩餘的訓練步驟(Horizon),在無限期或開放式訓練中應用可能較具挑戰性。

延伸閱讀

減少解碼器反而增強編碼器:從新視角合成中提煉強大三維幾何表徵
arXivAI 研究

減少解碼器反而增強編碼器:從新視角合成中提煉強大三維幾何表徵

Less Decoder is More Encoder: Extracting Robust 3D Geometric Representations via Novel View Synthesis

本研究揭示了新視角合成模型(NVS)中解碼器過強會稀釋幾何表徵的弊端,並提出 SNAP 架構,透過限制解碼器與採用潛在空間重建,大幅提升編碼器的三維幾何學習能力。

2 分鐘閱讀