Pivot-SD:針對遮罩擴散語言模型的高效自我蒸餾框架
Pivot-SD: Efficient Self-Distillation for Masked Diffusion Language Models
遮罩擴散語言模型(dLMs)在複雜推理中具備平行生成的潛力,但去噪過程中僅有少數關鍵決策(pivots)會決定最終的生成品質,傳統方法難以對此進行精準的「信用分配」。為了克服此難題,研究人員提出 Pivot-SD。該框架利用資訊增益指標,篩選出大幅降低剩餘遮罩不確定性的樞紐標記(pivots)。針對成功的軌跡,僅對其樞紐進行交叉熵微調;針對失敗軌跡,則僅對其樞紐進行目標非概似(targeted unlikelihood)訓練,其餘部分保持不變。在僅使用 200 個問題的極低數據成本下,成功提升了 LLaDA-8B-Instruct 在數學與程式基準測試中的表現。
核心重點
突破信用分配瓶頸
解決了擴散語言模型去噪過程中,整條序列訓練無法區分關鍵決策與一般步驟的信用分配難題。
資訊增益篩選樞紐
利用資訊增益指標,精確計算並篩選出能最大程度消除剩餘遮罩位置不確定性的樞紐決策。
雙向非對稱優化
對成功的樞紐進行交叉熵訓練,對失敗的樞紐進行目標非概似(targeted unlikelihood)訓練,避免誤傷正確部分。
極高樣本效率
僅需 200 個問題與每個問題 4 次 rollout 即可完成微調,顯著超越全序列 SFT 與強化學習基準線。
技術圖解
為什麼重要
非自迴歸的遮罩擴散語言模型具備優異的平行生成優勢,但在後訓練對齊(alignment)上一直缺乏高效且低成本的方案。Pivot-SD 證實了無需龐大的算力與複雜的強化學習演算法,只需針對極少數的「關鍵決策」進行外科手術式的精準微調,就能大幅提升 LLaDA 等擴散語言模型在數學推理與程式編寫上的表現,為未來非自迴歸架構的大型語言模型訓練開闢了全新、高性價比的研究路徑。
對誰有影響
- AI 研究人員
- AI 開發者
可以怎麼使用
- 1優化平行擴散語言模型(如 LLaDA)在有限算力與數據集下的數學與程式推理能力。
- 2使用離線自我蒸餾機制,為非自迴歸語言模型進行快速的後訓練對齊與校準。
限制與注意事項
- 目前主要在數學與程式等具有明確解答的基準測試中驗證,在開放式、長文寫作等場景的泛用性仍需探索。
- 依賴顯式的資訊增益計算,在離線數據準備階段會引入額外的運算開銷。
延伸閱讀
減少解碼器反而增強編碼器:從新視角合成中提煉強大三維幾何表徵
Less Decoder is More Encoder: Extracting Robust 3D Geometric Representations via Novel View Synthesis
本研究揭示了新視角合成模型(NVS)中解碼器過強會稀釋幾何表徵的弊端,並提出 SNAP 架構,透過限制解碼器與採用潛在空間重建,大幅提升編碼器的三維幾何學習能力。
4DCodeBench:評估 AI Agent 動態場景 4D 反向圖形學與程式碼生成能力的全新基準
4DCodeBench: Benchmarking AI Agents on 4D Inverse Graphics and Dynamic Scene Code Generation
4DCodeBench 是一個全新基準測試,旨在評估 AI Agent 藉由生成可執行物理繪圖程式,從影片中重建 4D 動態場景的能力。
世界模型該遺忘什麼?以「分層保留」實現持續適應環境的能力
What Should World Models Forget? Stratified Retention for Continual Adaptation
本研究指出世界模型在持續學習時不應一味避免遺忘,而須透過「分層保留」區分永恆不變的物理定律與需要隨環境即時更新的動態事實。