LESSER:僅用輸出層梯度,實現高達 9.7 倍加速的 LLM 訓練後資料篩選
LESSER: High-Efficiency Post-Training Data Selection Using Output-Layer Gradients
在大語言模型(LLM)的微調過程中,選擇合適的訓練後資料對最終效能至關重要。然而,傳統基於梯度的篩選法需要計算所有候選樣本的全參數梯度,其反向傳播(backward pass)的運算成本極為高昂。對此,LESSER 框架提出了創新的解決方案:僅利用輸出層梯度進行篩選。這種方式僅需成本極低的前向傳播(forward pass),便能在 SFT 與 RL 任務中分別降低 9.7 倍與 3.0 倍的 FLOP 運算成本,且篩選出的資料在下游任務表現上,能與使用昂貴全參數梯度篩選出的資料相媲美。
核心重點
免去全反向傳播
LESSER 證明了僅靠輸出層梯度即可進行有效的資料篩選,避開了全參數梯度的昂貴反向傳播計算。
大幅降低運算成本
在監督式微調(SFT)中降低了 9.7 倍的運算成本,在強化學習(RL)基準測試中也降低了 3.0 倍。
精準對齊下游表現
儘管運算成本大幅降低,LESSER 篩選出的資料在下游任務中的表現依然與全參數梯度方法高度一致。
批次梯度的神奇對齊
實驗發現,雖然輸出層梯度和全梯度對單一資料點的排序可能不同,但它們最終選出的資料批次(batches)卻具有對齊的梯度。
為什麼重要
隨著 LLM 規模日益龐大,自訂對齊(如 SFT 與 RLHF)的資料篩選已成為一項沉重的算力負擔。LESSER 的突破在於打破了「精準篩選必須依賴全模型反向傳播」的迷思。僅用輸出層梯度與前向傳播,就能在近乎無損的效能下將成本縮減至原來的十分之一。這讓資源有限的企業或研究團隊,也能高效且低成本地優化自有的客製化 AI 模型。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1監督式微調(SFT)的資料高效篩選
- 2強化學習(RL)對齊資料集的低成本過濾
限制與注意事項
- 在單個樣本的排序上,可能與全參數梯度方法存在偏差,需依賴批次效應來實現對齊。
- 作為外殼程式(wrapper),其最終效果仍取決於所搭配的底層資料篩選演算法。
延伸閱讀
TACO 最佳化器:將 32B 大模型全參數微調帶入單張 GPU 的極簡幾何學
TACO Optimizer: Unleashing Full-Parameter 32B LLM Fine-Tuning on a Single GPU
TACO 是一款新型超低記憶體最佳化器,透過在權重矩陣每行中僅保留最大幅度的梯度符號,將最佳化器狀態記憶體縮減 174 倍,讓單張 GPU 即可微調 32B 模型。
層級連續擴散語言模型:結合離散 Token 與連續潛在軌跡的全新生成架構
Hierarchical Continuous Diffusion Language Models: Coupling Discrete Tokens with Continuous Latents
HC-DLM 透過將離散 Token 生成與連續潛在軌跡結合於單一去噪過程中,克服了傳統離散與連續擴散語言模型的局限性,在結構化推理與語言建模任務上表現優異。

Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構
Introducing Olmo-core 3: Open, Scalable Training Infrastructure for Trillion-Parameter MoEs
Olmo-core 3 是專為兆級參數 Mixture-of-Experts (MoE) 模型打造的開源訓練框架,大幅提升吞吐量並解決分散式訓練中的通訊瓶頸。