arXiv大型語言模型
Flash-dLLM:為擴散大語言模型打造的 I/O 感知 KV 快取與平行解碼加速框架
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。
2 分鐘閱讀
#dllm
1 篇文章
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。