Aivora
arXiv大型語言模型進階

伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM

Telescopic Language Models: One Training Run for Endless Compute Budgets

2 分鐘閱讀
伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM
30 秒看懂

當前要滿足不同的推論運算預算,通常需要針對各個尺寸單獨訓練或壓縮模型。現有的「套娃語言模型(MLMS)」僅能提供少數固定的出口,若在非預設層退出則會導致效能崩潰。TLM 透過在訓練時隨機對容量軸進行前綴截斷監督(stochastic prefix supervision),並結合完整容量的錨點(full anchor),使模型在所有 20 個層級前綴上皆具備優秀的語言生成能力。在 200M 模型與 20B FineWeb-Edu 標記(tokens)的測試中,TLM 在不損失完整容量效能的前提下,將品質-預算曲線下面積降低了 43-44%,同時降低了 12% 的 GPU 訓練成本。

核心重點

01

無縫的連續容量

只需一次訓練,模型即可在任何層數深度(層前綴)進行解碼,提供真正連續且彈性的運算預算選擇。

02

隨機前綴監督

在每個訓練步驟中,隨機截斷深度進行下一標記預測,並與完整深度的 forward-backward 步驟結合,確保每一層都是有效的語言模型。

03

完美解決非出口失效

相較於在非出口層 perplexity 會暴增到 10^2-10^5 的套娃模型,TLM 在所有深度上均能保持平滑且優異的效能表現。

04

更低的訓練成本

無需修改任何硬體或模型架構,且因只需雙重前向/反向傳播,其 GPU 訓練成本比固定出口套組降低了約 12%。

技術圖解

TLM 與傳統固定出口套娃模型 (MLMS) 比較
Matryoshka Suites (MLMS)Telescopic LM (TLM)
支援的出口深度僅限預先設定的少數固定出口層任何層前綴(整個容量軸連續有效)
非預設層的表現極差(困惑度達 10^2 - 10^5)維持高水準,效能隨深度平滑過渡
GPU 訓練成本基準 (100%)比 MLMS 降低約 12%
品質-預算曲線面積基準面積減少約 43% - 44%

為什麼重要

這項研究證明了「訓練目標」才是決定模型是否具備彈性的關鍵,而非模型架構。這徹底改變了彈性模型的設計思路:企業和開發者不必再為不同的硬體(如手機、瀏覽器、雲端伺服器)訓練多個模型,或設定繁瑣的固定退出層。只需訓練一個 TLM,就能在推論時根據當前的硬體負載、電力狀態或延遲要求,動態且平滑地截斷層數,大幅優化伺服器群的資源調度效率。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1動態推論負載調度:在高流量時動態減少推論層數以降低延遲,在離峰時自動切換至全深度以提供最高品質。
  2. 2異質硬體一鍵部署:單一模型權重分發到手機、筆電和雲端,各裝置依據自身算力無縫選擇合適的運算層數。

限制與注意事項

  • 目前實驗主要在 200M 參數規模的代理模型上進行驗證,其在百億級(Multi-Billion)大語言模型上的可擴展性仍有待實證。
  • 儘管相較於 MLMS 降低了訓練成本,但由於每步訓練需要執行隨機前綴與完整容量的雙重前向/反向傳播,其運算量仍高於一般單一標準模型的訓練。

延伸閱讀

微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出
arXiv大型語言模型

微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出

Minimally Invasive Steering of LMs: Optimizing Rewards Without Quality Degradation

本研究提出 MISVO 技術,利用局部 KL 幾何(Fisher 二次式)懲罰過度干預,在不更新模型參數的前提下引導語言模型,能在維持生成多樣性與連貫性的同時提升獎勵分數。

2 分鐘閱讀
LFM2.5-VL-DSpark:以超低開銷將多模態模型推論速度提升達 3 倍
Hugging Face大型語言模型

LFM2.5-VL-DSpark:以超低開銷將多模態模型推論速度提升達 3 倍

LFM2.5-VL-DSpark: Accelerating Vision-Language Models with Minimal Overhead

Liquid AI 針對 LFM2.5-VL-3B 模型推出僅 2.8 億參數的 DSpark 草稿模型,可在不犧牲準確度的前提下,將邊緣裝置與 GPU 的解碼速度提升高達 3.13 倍。

2 分鐘閱讀