LeapQuant:突破線性注意力瓶頸,實現近乎無損的 8-bit 遞迴狀態量化
LeapQuant: Near-Lossless 8-Bit Recurrent State Quantization for Linear Attention LLMs
隨著混合結構 LLM(如 GDN、KDA)逐漸採用線性注意力來壓縮長文本,頻繁讀寫遞迴狀態(Recurrent State)成為推論的主要瓶頸。量化雖能降低成本,卻容易因誤差累積與離群值(Outliers)造成模型精度大幅下降。LeapQuant 提出一種免訓練的 8-bit 量化方案:它採用「逐視窗量化」跳過頻繁更新以減少誤差累積,並將狀態中的極端離群值保留為高精度的「補償 Token」(Compensator Tokens),最後對剩餘殘差進行平滑化。在 Qwen、Kimi 與 GLM 等模型上的測試顯示,它在硬體上可達到 1.47 倍的端到端加速,且精度與 FP32 相當。
核心重點
逐視窗量化減少誤差
跳過逐個 token 更新的頻繁步驟,改為在一個 token 視窗結束時才進行一次量化,視窗內則結合低位元狀態與高精度緩衝更新。
補償 Token 保留極端值
將遞迴狀態中的最大離群值(Outliers)保留為高精度的「補償 Token」,並使其共用真實 token 的更新路徑以減輕量化誤差。
殘差平滑化處理
在量化前對剩餘的殘差進行平滑化調整,進一步縮小因數值分布不均而帶來的量化精度損失。
極佳的推論加速表現
在 NVIDIA B200、RTX PRO 6000 和 RTX 5090 GPU 上,核心級加速達 2.05 至 3.70 倍,端到端推論加速達 1.47 倍。
技術圖解
為什麼重要
隨著長文本處理需求暴增,線性注意力(Linear Attention)已被視為克服傳統 Transformer 長度瓶頸的重要架構,但其遞迴狀態的量化難題一直未解。LeapQuant 證明了無需重新訓練模型,就能將遞迴狀態安全地量化至 8-bit。這項研究為次世代混合架構 LLM 在消費級(如 RTX 5090)和企業級(如 B200)顯示卡上的高效、低成本部署鋪平了道路。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1長文本混合架構 LLM(如 Kimi Delta Attention、Gated DeltaNet)的硬體部署與加速
- 2在記憶體受限的邊緣裝置或消費級 GPU(如 RTX 5090)上運行大型語言模型
限制與注意事項
- 專為線性注意力與混合架構模型設計,可能無法直接應用於傳統的 Softmax 全局注意力模型
- 在局部視窗內仍需保留高精度的緩衝更新,這在特定超參數下可能佔用些許記憶體
延伸閱讀
STEPQuant:空間與時間雙重優化,突破線性注意力循環狀態量化瓶頸
STEPQuant: Spatial-Temporal Quantization for Linear Attention Recurrent States
本研究提出 STEPQuant 框架,針對線性注意力模型中的循環狀態進行空間與時間維度的後訓練量化,在 6-bit 預算下幾乎無損保留精度,並減少高達 68.7% 的伺服記憶體開銷。
伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM
Telescopic Language Models: One Training Run for Endless Compute Budgets
這項研究提出 Telescopic Language Models (TLM),透過隨機前綴監督與完整錨點訓練,讓單一 Transformer 模型在任何深度皆能作為有效的語言模型運作,不需為多種運算預算重複進行訓練或壓縮。
微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出
Minimally Invasive Steering of LMs: Optimizing Rewards Without Quality Degradation
本研究提出 MISVO 技術,利用局部 KL 幾何(Fisher 二次式)懲罰過度干預,在不更新模型參數的前提下引導語言模型,能在維持生成多樣性與連貫性的同時提升獎勵分數。