arXiv大型語言模型
Flash-dLLM:為擴散大語言模型打造的 I/O 感知 KV 快取與平行解碼加速框架
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。
2 分鐘閱讀
LLM
大型語言模型的架構、訓練、評測與新模型發布。
2 篇文章
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。
Type-Safe Is Not Error-Free: Constrained Decision Heads Follow Option Names, Not Their Rubrics
研究指出,限制輸出格式的「類型安全」決策模型,其決策極易受選項名稱字面語意(如 yes/no)的誤導,進而忽略實際綁定的評判規則,導致決策準確度劇烈下滑甚至完全相反。