Aivora
arXivAI 研究專業

結合零階與一階優化:ZFO 框架為大語言模型微調尋找最佳步長

Decoupling Direction and Step-Size: ZFO Framework for LLM Fine-Tuning

2 分鐘閱讀
結合零階與一階優化:ZFO 框架為大語言模型微調尋找最佳步長
30 秒看懂

在大型類神經網路優化中,步長(學習率)的選擇至關重要:太保守會導致收斂緩慢,太激進則容易使訓練崩潰。為此,研究團隊開發了輕量化的 ZFO 框架。ZFO 首先利用傳統一階優化器(如梯度)選定更新方向,接著僅在該一維子空間上進行兩次零階函數評估,藉此建立局部目標函數模型,並在限制區間內計算出感知曲率的步長。此方法比傳統的完整線搜尋(Line Search)成本更低,且在多個語言模型微調任務中,皆優於傳統固定步長的一階基準方法。

核心重點

01

解耦方向與步長

利用一階優化器決定參數更新方向,再透過零階評估決定在該方向上應前進多遠。

02

極低的額外計算開銷

每次更新僅需當前梯度與兩次額外的前向傳播(函數評估),成本遠低於完整線搜尋(Line Search)。

03

曲率感知自適應

利用有限差分曲率估計建立局部目標函數模型,在限制的搜尋區間內挑選近乎最優的步長。

04

堅實的收斂與理論保證

證明了共享樣本評估能產生可靠的曲率估計,並保證算法能收斂至平穩點的鄰域。

技術圖解

ZFO 步長自適應優化流程
沿一維子空間估算有限差分搜尋限制區間應用步長確定方向2次零階評估建立局部曲率模型計算最佳步長更新模型參數

為什麼重要

傳統的大語言模型微調高度依賴人工調整學習率或複雜的排程(Scheduler),一旦設定不當就會浪費龐大的算力。ZFO 提供了一種自動且輕量化的步長自適應機制。由於它只需要額外兩次前向傳播(函數評估),卻能顯著提升收斂穩定度與最終性能,這為超大規模模型的極速、穩定微調開闢了新的優化路徑。

對誰有影響

  • AI 開發者
  • AI 研究人員

可以怎麼使用

  1. 1大語言模型(LLM)高效微調,自動調整步長以防訓練崩潰。
  2. 2資源受限環境下的自適應優化,代替高成本的傳統線搜尋。

限制與注意事項

  • 每步仍需額外進行兩次目標函數評估(前向傳播),在極大規模模型上仍會增加些許時間開銷。
  • 最優的局部模型選擇(Local Model)高度取決於具體的任務目標與數據集特徵。

延伸閱讀

GALA:用線性混合變形蒸餾技術實現 3D Gaussian 虛擬化身即時動畫
arXivAI 研究

GALA:用線性混合變形蒸餾技術實現 3D Gaussian 虛擬化身即時動畫

GALA: Distilling 3D Gaussian Avatars into Linear Blendshapes for Real-Time Animation

本研究提出 GALA 方法,將預訓練 3D Gaussian 虛擬化身複雜的神經解碼蒸餾為輕量化線性 blendshape,在維持渲染品質的同時,將 CPU 動畫運算成本降低高達三個數量級,並在行動裝置上實現 60fps 即時動畫。

2 分鐘閱讀
ScholarCatalyst:評估 AI 是否擁有「科學家直覺」的學術文獻檢索基準
arXivAI 研究

ScholarCatalyst:評估 AI 是否擁有「科學家直覺」的學術文獻檢索基準

ScholarCatalyst: A Benchmark for Testing AI's Intuition in Retrieving Inspiring Research Papers

ScholarCatalyst 是一個新型評估基準,由 184 位電腦科學論文作者親自標記啟發其研究的先前文獻,測試 AI 能否在專案初期僅憑初步構想,精準檢索出關鍵的靈感來源。

2 分鐘閱讀