arXiv大型語言模型
Flash-dLLM:為擴散大語言模型打造的 I/O 感知 KV 快取與平行解碼加速框架
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。
2 分鐘閱讀
#inference-optimization
2 篇文章
Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast Diffusion LLMs
Flash-dLLM 是一個免訓練的推論加速框架,透過融合的 I/O 感知 KV 快取與自我草稿驗證解碼技術,大幅提升擴散大語言模型(dLLM)的推論速度與記憶體效率。
Grow the Harness, Not the Context: Building Low-Cost Specialist Agents via Failure-Guided Code Synthesis
Growing Harness 是一種新型的 Agent 訓練範式,它不依賴大模型在 context 中重複進行控制決策,而是透過失敗導向的程式碼生成與修復,將重複的控制邏輯固化為可執行的程式碼框架,使 4B 小模型也能發揮媲美大模型的效果,並降低高達 98% 的推論成本。