Liquid AI发布LFM2.5-VL-DSpark:VLM推理加速3.13倍

Liquid AI发布VLM草稿模型DSpark。该方案仅增加280M参数,在设备端实现最高3.13倍解码加速,支持llama.cpp等主流框架,以低内存开销显著提升推理速度。

Liquid AI 发布 LFM2.5-VL-DSpark:为视觉语言模型提供投机解码加速

Liquid AI 近日发布了针对其视觉语言模型(VLM)LFM2.5-VL-3B 的实验性 DSpark 草稿模型。该模型通过引入投机解码(Speculative Decoding)路径,旨在以极小的内存开销换取显著的推理速度提升,同时保持输出质量不变。

设备端解码加速最高3.13倍

主要特性包括:

  • 推理加速:在设备端实现最高 3.13x 的解码加速,在 H100 GPU 上实现 2.66x 的解码加速;端到端延迟分别降低至原来的 2.62x 和 2.27x。
  • 低内存成本:草稿模型仅增加约 280M 参数,相比 3B 目标模型的参数量增幅为 8.9%。
  • 广泛支持:首日即支持 llama.cpp、MLX-VLM 和 SGLang 等主流推理框架。

VLM 投机解码的技术原理

视觉草稿器采用了与文本版 LFM2.5-DSpark 相同的架构设计。它捕获目标模型在特定层级的隐藏状态,并以此为基础起草 k 个候选代币块。图像补丁和文本代币在进入这些层级前被投射到共享表示空间中,使得草稿器能够处理统一维度的隐藏状态向量,无论输入模态如何。因此,其推断算法逻辑与纯文本模型保持一致。

训练配置与模型结构

训练过程中使用了混合视觉语言监督微调(SFT)数据,并根据预期工作负载进行加权。基于第 3、4 和 5 层的剥离技术,该草稿模型是一个简化的仅关注型(attention-only)架构,包含 4 个层级和 9 个块大小。模型在最终混合数据集上运行了 10 个 epoch,并在每个 epoch 后测量接受率。推断时建议根据硬件条件选择 8 或 9 的块大小。

生成的草稿模型总参数量约为 280M,具体构成如下:

组成部分 参数量
解码器堆栈 (4 层) 193.0M
隐藏状态投影 21.0M
马尔可夫头 65.5M
规范化 + 置信度头 6.4k
总计 279.5M

CPU 与 GPU 上的性能实测

Liquid AI 在多种硬件配置下评估了 DSpark 对 LFM2.5-VL-3B 的加速效果。测试使用 MMSpec 基准,涵盖一般 VQA、文本 VQA、图片描述、图表 VQA、复杂推理和多轮对话六类视觉任务。所有配置均使用大小为 8 的 DSpark 块。

设备端推断:

  • 在搭载 MLX 的 Apple M5 Max 上,解码速度提升 2.30x 至 3.13x,端到端延迟改善 1.56x 至 2.62x。
  • 在搭载 llama.cpp 的 Apple M3 Ultra 上,解码性能提升 1.57x 至 2.14x,端到端性能提升 1.30x 至 1.77x。

GPU 推断:

在 NVIDIA H100 上,同一草稿模型实现了 2.04x 至 2.66x 的解码加速,端到端改进幅度为 1.64x 至 2.27x。

视觉工作负载中的投机解码局限性

在大语言模型中,预填充阶段通常是计算密集型的,其成本随提示长度呈二次方增长。对于视觉语言模型,图像首先通过视觉编码器处理,随后语言主干网络需处理数百个视觉代币及文本提示。由于边缘设备的算力远低于数据中心 GPU,预填充阶段占据了更多的端到端延迟时间。

根据阿姆达尔定律,整体加速比受限于未加速部分的时间占比。当视觉编码或预填充阶段已占据大部分墙钟时间时,即便解码阶段大幅加速,端到端的总体提升也将受到限制。

部署指南

用户可通过以下命令在不同框架中启用 LFM2.5-VL-DSpark:

使用 SGLang:

需要集成 DSpark 支持的 SGLang 构建版本(参考 PR #40651)。启动命令示例:

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

服务启动后,可通过 OpenAI 兼容端点 http://localhost:30000/v1 进行查询。块大小从草稿模型的 config.json 中读取;移除三个 --speculative-* 标志即可运行基线模型。

使用 llama.cpp:

需要相应的 llama.cpp 构建版本(参考 PR #29339):

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

使用 MLX-VLM:

需要相应的 MLX-VLM 构建版本(参考 PR #2280):

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

注:投机解码是精确的,目标模型会验证每一个建议的代币,确保贪心输出的结果与仅使用目标模型时完全一致。响应时间报告格式为 draft_n / draft_n_accepted。

获取方式

LFM2.5-VL-DSpark 草稿模型已在 Hugging Face 平台上线,提供 Safetensors 和 GGUF 两种格式下载。

引用信息:

@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读