伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM
Telescopic Language Models: One Training Run for Endless Compute Budgets
當前要滿足不同的推論運算預算,通常需要針對各個尺寸單獨訓練或壓縮模型。現有的「套娃語言模型(MLMS)」僅能提供少數固定的出口,若在非預設層退出則會導致效能崩潰。TLM 透過在訓練時隨機對容量軸進行前綴截斷監督(stochastic prefix supervision),並結合完整容量的錨點(full anchor),使模型在所有 20 個層級前綴上皆具備優秀的語言生成能力。在 200M 模型與 20B FineWeb-Edu 標記(tokens)的測試中,TLM 在不損失完整容量效能的前提下,將品質-預算曲線下面積降低了 43-44%,同時降低了 12% 的 GPU 訓練成本。
核心重點
無縫的連續容量
只需一次訓練,模型即可在任何層數深度(層前綴)進行解碼,提供真正連續且彈性的運算預算選擇。
隨機前綴監督
在每個訓練步驟中,隨機截斷深度進行下一標記預測,並與完整深度的 forward-backward 步驟結合,確保每一層都是有效的語言模型。
完美解決非出口失效
相較於在非出口層 perplexity 會暴增到 10^2-10^5 的套娃模型,TLM 在所有深度上均能保持平滑且優異的效能表現。
更低的訓練成本
無需修改任何硬體或模型架構,且因只需雙重前向/反向傳播,其 GPU 訓練成本比固定出口套組降低了約 12%。
技術圖解
| Matryoshka Suites (MLMS) | Telescopic LM (TLM) | |
|---|---|---|
| 支援的出口深度 | 僅限預先設定的少數固定出口層 | 任何層前綴(整個容量軸連續有效) |
| 非預設層的表現 | 極差(困惑度達 10^2 - 10^5) | 維持高水準,效能隨深度平滑過渡 |
| GPU 訓練成本 | 基準 (100%) | 比 MLMS 降低約 12% |
| 品質-預算曲線面積 | 基準 | 面積減少約 43% - 44% |
為什麼重要
這項研究證明了「訓練目標」才是決定模型是否具備彈性的關鍵,而非模型架構。這徹底改變了彈性模型的設計思路:企業和開發者不必再為不同的硬體(如手機、瀏覽器、雲端伺服器)訓練多個模型,或設定繁瑣的固定退出層。只需訓練一個 TLM,就能在推論時根據當前的硬體負載、電力狀態或延遲要求,動態且平滑地截斷層數,大幅優化伺服器群的資源調度效率。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1動態推論負載調度:在高流量時動態減少推論層數以降低延遲,在離峰時自動切換至全深度以提供最高品質。
- 2異質硬體一鍵部署:單一模型權重分發到手機、筆電和雲端,各裝置依據自身算力無縫選擇合適的運算層數。
限制與注意事項
- 目前實驗主要在 200M 參數規模的代理模型上進行驗證,其在百億級(Multi-Billion)大語言模型上的可擴展性仍有待實證。
- 儘管相較於 MLMS 降低了訓練成本,但由於每步訓練需要執行隨機前綴與完整容量的雙重前向/反向傳播,其運算量仍高於一般單一標準模型的訓練。
延伸閱讀
微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出
Minimally Invasive Steering of LMs: Optimizing Rewards Without Quality Degradation
本研究提出 MISVO 技術,利用局部 KL 幾何(Fisher 二次式)懲罰過度干預,在不更新模型參數的前提下引導語言模型,能在維持生成多樣性與連貫性的同時提升獎勵分數。

NVIDIA Transformer Engine 加速生物基礎模型 MoE 訓練:吞吐量提升達 2.21 倍
Accelerating MoE Training for Biological Foundation Models with NVIDIA Transformer Engine
本文介紹如何利用 NVIDIA BioNeMo 與 Transformer Engine 的優化算子,克服混合專家模型(MoE)在生物學應用中的訓練瓶頸,將訓練吞吐量提升至 2.21 倍。

LFM2.5-VL-DSpark:以超低開銷將多模態模型推論速度提升達 3 倍
LFM2.5-VL-DSpark: Accelerating Vision-Language Models with Minimal Overhead
Liquid AI 針對 LFM2.5-VL-3B 模型推出僅 2.8 億參數的 DSpark 草稿模型,可在不犧牲準確度的前提下,將邊緣裝置與 GPU 的解碼速度提升高達 3.13 倍。