arXiv大型語言模型
STEPQuant:空間與時間雙重優化,突破線性注意力循環狀態量化瓶頸
STEPQuant: Spatial-Temporal Quantization for Linear Attention Recurrent States
本研究提出 STEPQuant 框架,針對線性注意力模型中的循環狀態進行空間與時間維度的後訓練量化,在 6-bit 預算下幾乎無損保留精度,並減少高達 68.7% 的伺服記憶體開銷。
2 分鐘閱讀
#linear-attention
1 篇文章
STEPQuant: Spatial-Temporal Quantization for Linear Attention Recurrent States
本研究提出 STEPQuant 框架,針對線性注意力模型中的循環狀態進行空間與時間維度的後訓練量化,在 6-bit 預算下幾乎無損保留精度,並減少高達 68.7% 的伺服記憶體開銷。