Aivora
Hugging Face大型語言模型進階

LFM2.5-VL-DSpark:以超低開銷將多模態模型推論速度提升達 3 倍

LFM2.5-VL-DSpark: Accelerating Vision-Language Models with Minimal Overhead

2 分鐘閱讀
LFM2.5-VL-DSpark:以超低開銷將多模態模型推論速度提升達 3 倍
30 秒看懂

Liquid AI 推出針對其 LFM2.5-VL-3B 視覺語言模型的 DSpark 輕量化推測解碼草稿模型。該模型僅增加 2.8 億參數(約 8.9% 的額外記憶體開銷),透過將影像區塊與文字投影至共享維度的表示空間,使草稿模型能以完全相同的架構進行解碼預測。測試顯示,在 M5 Max 晶片上解碼速度提升達 3.13 倍,H100 上提升達 2.66 倍,首日即原生支援 llama.cpp、MLX-VLM 與 SGLang。

核心重點

01

顯著的解碼加速

在 Apple M5 Max 邊緣裝置上實現高達 3.13 倍的解碼加速(端到端 2.62 倍),在 H100 GPU 上則可提升達 2.66 倍。

02

極低的記憶體開銷

草稿模型僅有 2.8 億(280M)參數,只佔主模型大小的 8.9%,能以極小的硬體負擔實現高效率加速。

03

統一的多模態架構

影像區塊與文字 Token 會在關鍵層前投影至相同維度,使草稿模型無須改變演算法即可同時處理多模態輸入。

04

開箱即用的開源生態

提供 Safetensors 與 GGUF 格式,發布首日即全面相容於 llama.cpp、MLX-VLM 與 SGLang 等熱門推理框架。

技術圖解

LFM2.5-VL-DSpark 多模態推推測解碼流程
多模態輸入維度對齊擷取特徵層平行驗證影像與文字輸入投影至共享空間目標模型隱藏狀態DSpark 預測 K 個 Token3B 目標模型驗證

為什麼重要

這項進展證明推測解碼(Speculative Decoding)可以無縫應用在多模態視覺模型上。僅需不到 9% 的額外記憶體,就能在不改變模型輸出品質的前提下顯著降低延遲。這讓在筆記型電腦或行動端等邊緣裝置上運行即時、流暢的視覺 AI 應用變得更為可行,大幅降低了多模態應用的部署門檻。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1邊緣裝置(如 Apple Silicon 筆電)上的即時視覺問答(VQA)與圖表分析。
  2. 2使用 SGLang 或 llama.cpp 進行高吞吐量、低延遲的視覺語言模型(VLM)服務部署。

限制與注意事項

  • 推測解碼僅能加速解碼階段,預填充(Prefill)與視覺編碼階段仍受限於硬體算力(阿姆達爾定律)。
  • 在輸入超長提示詞或超高解析度影像等預填充佔比較高的場景中,端到端的實際加速效果會被壓縮。

延伸閱讀

微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出
arXiv大型語言模型

微創型語言模型導向技術:利用 MISVO 在不損害生成品質下優化輸出

Minimally Invasive Steering of LMs: Optimizing Rewards Without Quality Degradation

本研究提出 MISVO 技術,利用局部 KL 幾何(Fisher 二次式)懲罰過度干預,在不更新模型參數的前提下引導語言模型,能在維持生成多樣性與連貫性的同時提升獎勵分數。

2 分鐘閱讀
以 MaxText 重現 OLMo 3 7B 預訓練:Google Cloud TPU 大規模訓練實戰指南
Google AI Developers大型語言模型

以 MaxText 重現 OLMo 3 7B 預訓練:Google Cloud TPU 大規模訓練實戰指南

Reproducing OLMo 3 7B Pre-training in MaxText: A Case Study of Large-Scale Training on TPUs

本文詳述如何使用 JAX 驅動的 MaxText 框架,在 Google Cloud TPU 上成功重現 AI2 開源模型 OLMo 3 7B 的預訓練與中期訓練階段,並分享效能最佳化與偵錯經驗。

2 分鐘閱讀