Aivora
arXiv大型語言模型專業

STEPQuant:空間與時間雙重優化,突破線性注意力循環狀態量化瓶頸

STEPQuant: Spatial-Temporal Quantization for Linear Attention Recurrent States

2 分鐘閱讀
STEPQuant:空間與時間雙重優化,突破線性注意力循環狀態量化瓶頸
30 秒看懂

線性注意力模型雖能以固定大小的「循環狀態」取代隨長度增長的 KV Cache,但在高併發伺服時,這些狀態仍會帶來龐大記憶體負擔。直接將其量化至低精度會導致誤差在遞迴更新中累積放大。為解決此問題,STEPQuant 框架從時間(分析記憶體存活期與誤差大小)與空間(結合鍵列與值行尺度分布)雙重維度出發,動態分配精度並進行聯合尺度擬合。實驗顯示,其在 6-bit 下能逼近 FP32 的精度,並已整合至 SGLang 實現 5 倍以上的狀態壓縮與顯著的記憶體節省。

核心重點

01

時間誤差傳播控制

解決長期記憶中的量化誤差隨時間步驟持續累積的問題,依據記憶存活期與誤差大小動態分配精度。

02

空間維度敏感度適應

針對不同鍵列對輸出影響的差異,以及行列間不均勻的狀態分布,進行鍵列與值行的縮放尺度聯合擬合。

03

極致的伺服記憶體節省

整合至 SGLang 並搭配優化 GPU 核心,實現 5 倍以上狀態壓縮,並減少高達 68.7% 的總推論伺服記憶體。

04

低位元下保留高精度

在 Qwen3.8-27B 和 Kimi-Linear-48B 測試中,6-bit 幾無損於原始精度,而 4-bit 組態表現亦優於傳統 INT8。

技術圖解

STEPQuant 空間-時間量化流程
檢測存活期分析行列分布分配 bit 數套用縮放因子核心加速循環狀態資料時間維度分析空間維度分析精度動態分配行列尺度擬合低精度量化狀態SGLang 引擎部署

為什麼重要

隨著大語言模型往長文本與高併發伺服發展,傳統 Transformer 的 KV Cache 記憶體開銷成為重大瓶頸。線性注意力模型雖提供固定大小狀態的解法,但其遞迴狀態的量化一直因誤差累積而難以突破。STEPQuant 克服了這一瓶頸,證明在不犧牲精度的前提下,能將線性注意力模型的伺服效率提升到全新高度,為次世代超長文本模型落地鋪平道路。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1高併發線性注意力 LLM 的推論伺服優化
  2. 2超長文本生成任務中的記憶體開銷控制

限制與注意事項

  • 目前主要針對 Delta-rule 循環狀態進行設計,對其他非線性或特殊注意力機制的推廣性仍待驗證。
  • 需要硬體與推論引擎(如 SGLang)的專屬算子支持以完全釋放其性能優勢。

延伸閱讀

微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出
arXiv大型語言模型

微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出

Minimally Invasive Steering of LMs: Optimizing Rewards Without Quality Degradation

本研究提出 MISVO 技術,利用局部 KL 幾何(Fisher 二次式)懲罰過度干預,在不更新模型參數的前提下引導語言模型,能在維持生成多樣性與連貫性的同時提升獎勵分數。

2 分鐘閱讀