Aivora
arXivAI 研究專業

不需重新訓練!PoEM 演算法直接預測新獎勵函數的強化學習結果

PoEM: Predicting RL Outcomes Without Re-training Existing Policies

2 分鐘閱讀
不需重新訓練!PoEM 演算法直接預測新獎勵函數的強化學習結果
30 秒看懂

強化學習(RL)後訓練是讓 AI 模型對齊人類偏好的關鍵,但過程極耗算力且不穩定。麻省理工學院(MIT)團隊提出 PoEM 框架。他們發現,若新獎勵函數是現有獎勵的線性組合,其對應的新模型對數策略(log-policies)也會是現有模型對數策略的線性組合。即使非線性,這些策略在對數空間中仍呈現低秩特性。PoEM 僅需評估樣本,即可直接合成新模型的權重,完全省去重新進行 RL 訓練的昂貴成本。

核心重點

01

免除二次訓練

僅需現有的後訓練模型與新獎勵函數,不需重跑 RL 即可合成出目標模型。

02

對數空間線性關係

證明了當新獎勵是舊獎勵的線性組合時,對應的對數策略也是線性組合。

03

低秩空間泛化

即使獎勵非線性相關,策略在對數空間中仍呈現低秩子空間特性,可用少數基準模型進行優化估算。

04

跨模態驗證

成功在文字與影像等多種模態、真實與合成的獎勵函數上驗證其有效性。

技術圖解

PoEM 零訓練策略合成流程
目標定義評估樣本輸出套用係數提取對數策略直接合成新獎勵函數基準模型群估算組合係數對數空間組合新對齊策略

為什麼重要

傳統上,只要對齊目標(如安全性、幽默感、事實性)稍有改變,或需要結合多個獎勵,就必須耗費數百萬算力重新進行 RL(如 PPO、DPO)後訓練。PoEM 打破了這一限制,提供了一種「零訓練」的政策合成方法,能大幅降低 AI 後訓練的碳排放與研發成本,讓研究人員快速迭代不同的對齊組合。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1結合多個安全與寫作風格獎勵,不需重訓模型即可快速產出新策略
  2. 2針對新定義的獎勵函數,快速原型設計特化型的多模態模型

限制與注意事項

  • 需要一組已完成後訓練、且能涵蓋相關能力空間的「基準」模型
  • 理論線性對應假設了標準 RL 公式,若遇到極為複雜的非線性獎勵組合,可能產生近似誤差

延伸閱讀

FleXray:首款通用型全身體檢 X 光影像分割模型
arXivAI 研究

FleXray:首款通用型全身體檢 X 光影像分割模型

FleXray: Universal Generalist Model for Full-Body X-Ray Segmentation

FleXray 透過物理生成式資料引擎,利用 3D 電腦斷層(CT)資料模擬出具備標記的 2D X 光影像,成功實現能分割全身 60 種解剖結構的通用型 X 光分割模型。

2 分鐘閱讀