Aivora
arXiv大型語言模型專業

LESSER:僅用輸出層梯度,實現高達 9.7 倍加速的 LLM 訓練後資料篩選

LESSER: High-Efficiency Post-Training Data Selection Using Output-Layer Gradients

2 分鐘閱讀
LESSER:僅用輸出層梯度,實現高達 9.7 倍加速的 LLM 訓練後資料篩選
30 秒看懂

在大語言模型(LLM)的微調過程中,選擇合適的訓練後資料對最終效能至關重要。然而,傳統基於梯度的篩選法需要計算所有候選樣本的全參數梯度,其反向傳播(backward pass)的運算成本極為高昂。對此,LESSER 框架提出了創新的解決方案:僅利用輸出層梯度進行篩選。這種方式僅需成本極低的前向傳播(forward pass),便能在 SFT 與 RL 任務中分別降低 9.7 倍與 3.0 倍的 FLOP 運算成本,且篩選出的資料在下游任務表現上,能與使用昂貴全參數梯度篩選出的資料相媲美。

核心重點

01

免去全反向傳播

LESSER 證明了僅靠輸出層梯度即可進行有效的資料篩選,避開了全參數梯度的昂貴反向傳播計算。

02

大幅降低運算成本

在監督式微調(SFT)中降低了 9.7 倍的運算成本,在強化學習(RL)基準測試中也降低了 3.0 倍。

03

精準對齊下游表現

儘管運算成本大幅降低,LESSER 篩選出的資料在下游任務中的表現依然與全參數梯度方法高度一致。

04

批次梯度的神奇對齊

實驗發現,雖然輸出層梯度和全梯度對單一資料點的排序可能不同,但它們最終選出的資料批次(batches)卻具有對齊的梯度。

為什麼重要

隨著 LLM 規模日益龐大,自訂對齊(如 SFT 與 RLHF)的資料篩選已成為一項沉重的算力負擔。LESSER 的突破在於打破了「精準篩選必須依賴全模型反向傳播」的迷思。僅用輸出層梯度與前向傳播,就能在近乎無損的效能下將成本縮減至原來的十分之一。這讓資源有限的企業或研究團隊,也能高效且低成本地優化自有的客製化 AI 模型。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1監督式微調(SFT)的資料高效篩選
  2. 2強化學習(RL)對齊資料集的低成本過濾

限制與注意事項

  • 在單個樣本的排序上,可能與全參數梯度方法存在偏差,需依賴批次效應來實現對齊。
  • 作為外殼程式(wrapper),其最終效果仍取決於所搭配的底層資料篩選演算法。

延伸閱讀

Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構
Hugging Face大型語言模型

Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構

Introducing Olmo-core 3: Open, Scalable Training Infrastructure for Trillion-Parameter MoEs

Olmo-core 3 是專為兆級參數 Mixture-of-Experts (MoE) 模型打造的開源訓練框架,大幅提升吞吐量並解決分散式訓練中的通訊瓶頸。

2 分鐘閱讀