Aivora
arXiv大型語言模型專業

TACO 最佳化器:將 32B 大模型全參數微調帶入單張 GPU 的極簡幾何學

TACO Optimizer: Unleashing Full-Parameter 32B LLM Fine-Tuning on a Single GPU

2 分鐘閱讀
TACO 最佳化器:將 32B 大模型全參數微調帶入單張 GPU 的極簡幾何學
30 秒看懂

傳統 LLM 全參數微調受限於 AdamW 等最佳化器巨大的記憶體開銷。本研究提出 TACO 最佳化器,承襲 Muon 的最陡下降法視角,在二維權重矩陣的每一行中,僅選取絕對值最大的梯度元素並保留其正負號(三值化與極稀疏化)。在 OPT-13B 微調測試中,TACO 將最佳化器狀態記憶體從 AdamW8bit 的 27.7 GB 驟降至 0.16 GB(減少 174 倍),峰值訓練記憶體降低 2.9 倍,且維持與 AdamW 相當的精確度。這使開發者能在單張 80 GB H100 GPU 上,對 30-32B 規模的模型進行全參數微調。

核心重點

01

極致的狀態記憶體節省

在微調 OPT-13B 時,將持續性最佳化器狀態記憶體從 27.7 GB 壓縮至僅 0.16 GB,相較於 8-bit AdamW 減少了 174 倍。

02

行向一稀疏三值幾何

在二維權重矩陣的每一行中,僅提取絕對值最大的一項並保留其正負號,以極稀疏的三值狀態進行高效更新。

03

突破單卡微調極限

打破硬體限制,允許在單張 80 GB H100 GPU 上對多個模型家族的 30B 至 32B 參數模型進行完整的全參數微調。

04

維持原有的高精確度

克服了先前矩陣值最佳化器(如 Muon)可能造成的精確度退化,TACO 在提供極致輕量化的同時,能達到與 AdamW 相當的訓練表現。

技術圖解

微調 OPT-13B 的效能指標對比:AdamW8bit 對決 TACO
AdamW (8-bit)TACO (Ours)
持續性最佳化器狀態記憶體27.7 GB0.16 GB (省 174 倍)
訓練峰值記憶體80.6 GB27.5 GB (省 2.9 倍)
單張 H100 (80GB) 微調極限~13B 參數模型30B - 32B 參數模型
訓練精確度與收斂速度基準 (Baseline)與 AdamW 相當 (Comparable)

為什麼重要

傳統微調為了避開 AdamW 的高顯存消耗,多採用 LoRA 等參數高效微調技術。TACO 的出現證明了透過創新的幾何演算法,可將最佳化器狀態壓縮至近乎為零且不犧牲全參數微調的實力。這消除了昂貴 GPU 集群的門檻,讓學術界與中小型企業能用單張工作站等級的 GPU 自由微調 30B 級別的大模型,顯著加速開源社群的模型定制化與研發速度。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1在單張 80GB H100 GPU 上對 Llama 等 30B-32B 級別的開源模型進行全參數微調。
  2. 2在硬體預算有限的環境中,微調由 AdamW 預訓練的模型,同時維持優秀的幾何收斂性與精度。

限制與注意事項

  • 該最佳化器專為二維權重矩陣設計,對於偏置項(bias)或一維嵌入向量等非二維權重需額外處理。
  • 作為新提出的極稀疏最佳化幾何,其在超大規模模型(如 70B 以上)或極端超參數下的長期收斂穩定性仍需更多實踐檢驗。

延伸閱讀

Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構
Hugging Face大型語言模型

Olmo-core 3 登場:開源兆級參數 MoE 模型訓練基礎架構

Introducing Olmo-core 3: Open, Scalable Training Infrastructure for Trillion-Parameter MoEs

Olmo-core 3 是專為兆級參數 Mixture-of-Experts (MoE) 模型打造的開源訓練框架,大幅提升吞吐量並解決分散式訓練中的通訊瓶頸。

2 分鐘閱讀
SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配
arXiv大型語言模型

SCAPO:藉由半事實穩定性最佳化 RLVR 的 Token 級信用分配

SCAPO: Optimizing Token-Level Credit in RLVR via Semifactual Stability

本研究提出 SCAPO 演算法,藉由半事實提示干預衡量 Token 的穩定性,精準調整強化學習中的信用分配,顯著提升了大型語言模型的數學推理與泛化能力。

2 分鐘閱讀