STEPQuant:空間與時間雙重優化,突破線性注意力循環狀態量化瓶頸
STEPQuant: Spatial-Temporal Quantization for Linear Attention Recurrent States
線性注意力模型雖能以固定大小的「循環狀態」取代隨長度增長的 KV Cache,但在高併發伺服時,這些狀態仍會帶來龐大記憶體負擔。直接將其量化至低精度會導致誤差在遞迴更新中累積放大。為解決此問題,STEPQuant 框架從時間(分析記憶體存活期與誤差大小)與空間(結合鍵列與值行尺度分布)雙重維度出發,動態分配精度並進行聯合尺度擬合。實驗顯示,其在 6-bit 下能逼近 FP32 的精度,並已整合至 SGLang 實現 5 倍以上的狀態壓縮與顯著的記憶體節省。
核心重點
時間誤差傳播控制
解決長期記憶中的量化誤差隨時間步驟持續累積的問題,依據記憶存活期與誤差大小動態分配精度。
空間維度敏感度適應
針對不同鍵列對輸出影響的差異,以及行列間不均勻的狀態分布,進行鍵列與值行的縮放尺度聯合擬合。
極致的伺服記憶體節省
整合至 SGLang 並搭配優化 GPU 核心,實現 5 倍以上狀態壓縮,並減少高達 68.7% 的總推論伺服記憶體。
低位元下保留高精度
在 Qwen3.8-27B 和 Kimi-Linear-48B 測試中,6-bit 幾無損於原始精度,而 4-bit 組態表現亦優於傳統 INT8。
技術圖解
為什麼重要
隨著大語言模型往長文本與高併發伺服發展,傳統 Transformer 的 KV Cache 記憶體開銷成為重大瓶頸。線性注意力模型雖提供固定大小狀態的解法,但其遞迴狀態的量化一直因誤差累積而難以突破。STEPQuant 克服了這一瓶頸,證明在不犧牲精度的前提下,能將線性注意力模型的伺服效率提升到全新高度,為次世代超長文本模型落地鋪平道路。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1高併發線性注意力 LLM 的推論伺服優化
- 2超長文本生成任務中的記憶體開銷控制
限制與注意事項
- 目前主要針對 Delta-rule 循環狀態進行設計,對其他非線性或特殊注意力機制的推廣性仍待驗證。
- 需要硬體與推論引擎(如 SGLang)的專屬算子支持以完全釋放其性能優勢。
延伸閱讀
伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM
Telescopic Language Models: One Training Run for Endless Compute Budgets
這項研究提出 Telescopic Language Models (TLM),透過隨機前綴監督與完整錨點訓練,讓單一 Transformer 模型在任何深度皆能作為有效的語言模型運作,不需為多種運算預算重複進行訓練或壓縮。
微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出
Minimally Invasive Steering of LMs: Optimizing Rewards Without Quality Degradation
本研究提出 MISVO 技術,利用局部 KL 幾何(Fisher 二次式)懲罰過度干預,在不更新模型參數的前提下引導語言模型,能在維持生成多樣性與連貫性的同時提升獎勵分數。

NVIDIA Transformer Engine 加速生物基礎模型 MoE 訓練:吞吐量提升達 2.21 倍
Accelerating MoE Training for Biological Foundation Models with NVIDIA Transformer Engine
本文介紹如何利用 NVIDIA BioNeMo 與 Transformer Engine 的優化算子,克服混合專家模型(MoE)在生物學應用中的訓練瓶頸,將訓練吞吐量提升至 2.21 倍。