不需重新訓練!PoEM 演算法直接預測新獎勵函數的強化學習結果
PoEM: Predicting RL Outcomes Without Re-training Existing Policies
強化學習(RL)後訓練是讓 AI 模型對齊人類偏好的關鍵,但過程極耗算力且不穩定。麻省理工學院(MIT)團隊提出 PoEM 框架。他們發現,若新獎勵函數是現有獎勵的線性組合,其對應的新模型對數策略(log-policies)也會是現有模型對數策略的線性組合。即使非線性,這些策略在對數空間中仍呈現低秩特性。PoEM 僅需評估樣本,即可直接合成新模型的權重,完全省去重新進行 RL 訓練的昂貴成本。
核心重點
免除二次訓練
僅需現有的後訓練模型與新獎勵函數,不需重跑 RL 即可合成出目標模型。
對數空間線性關係
證明了當新獎勵是舊獎勵的線性組合時,對應的對數策略也是線性組合。
低秩空間泛化
即使獎勵非線性相關,策略在對數空間中仍呈現低秩子空間特性,可用少數基準模型進行優化估算。
跨模態驗證
成功在文字與影像等多種模態、真實與合成的獎勵函數上驗證其有效性。
技術圖解
為什麼重要
傳統上,只要對齊目標(如安全性、幽默感、事實性)稍有改變,或需要結合多個獎勵,就必須耗費數百萬算力重新進行 RL(如 PPO、DPO)後訓練。PoEM 打破了這一限制,提供了一種「零訓練」的政策合成方法,能大幅降低 AI 後訓練的碳排放與研發成本,讓研究人員快速迭代不同的對齊組合。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1結合多個安全與寫作風格獎勵,不需重訓模型即可快速產出新策略
- 2針對新定義的獎勵函數,快速原型設計特化型的多模態模型
限制與注意事項
- 需要一組已完成後訓練、且能涵蓋相關能力空間的「基準」模型
- 理論線性對應假設了標準 RL 公式,若遇到極為複雜的非線性獎勵組合,可能產生近似誤差
延伸閱讀

NVIDIA 推出首款開源 3D CT 醫療視覺語言模型 NV-Reason-CT,導入放射科醫師思考鏈推論
NVIDIA Introduces NV-Reason-CT: Open 3D CT VLM with Radiologist Chain-of-Thought Reasoning
NVIDIA 推出專為 3D 電腦斷層設計的開源視覺語言模型 NV-Reason-CT,結合 3D 視覺編碼器與 Qwen 語言模型,能模擬放射科醫師的思考鏈推論,生成結構化診斷報告並進行多輪問答。
「誰對誰說了什麼?」SpeakerMem-R1 打造多方對話專屬的雙軌記憶機制
Who Said What to Whom? SpeakerMem-R1 Introduces Dual-Track Memory for Multi-Party Dialogues
針對多人對話中複雜的角色關係與脈絡,SpeakerMem-R1 透過標記說話者的「雙軌記憶」與 GRPO 強化學習,大幅提升長文本對話中的訊息歸屬與關係追蹤能力。
FleXray:首款通用型全身體檢 X 光影像分割模型
FleXray: Universal Generalist Model for Full-Body X-Ray Segmentation
FleXray 透過物理生成式資料引擎,利用 3D 電腦斷層(CT)資料模擬出具備標記的 2D X 光影像,成功實現能分割全身 60 種解剖結構的通用型 X 光分割模型。