使用 LFM2.5-VL-DSpark 加速视觉语言模型

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-251042 阅读💛 256 收藏
使用 LFM2.5-VL-DSpark 加速视觉语言模型

📌 One-Sentence Summary

Liquid AI 发布了 LFM2.5-VL-DSpark,这是一个为 LFM2.5-VL-3B 视觉语言模型设计的实验性草稿模型,利用投机采样技术在极低内存开销下实现了高达 3.13 倍的解码速度提升。

📝 Summary

Liquid AI 推出了 LFM2.5-VL-DSpark,一个旨在加速 LFM2.5-VL-3B 视觉语言模型 (VLM) 的投机采样草稿模型。通过增加一个仅 280M 参数的纯注意力机制草稿模型,系统可以预测候选 Token 块,随后由目标模型进行验证,在确保输出质量完全一致的同时显著降低延迟。该模型在边缘设备 (Apple M 系列) 和数据中心 GPU (H100) 上均展现出显著的加速效果,并首日集成了 llama.cpp、MLX-VLM 和 SGLang。作者还讨论了投机采样在 VLM 中的局限性,指出根据 Amdahl 定律,虽然解码阶段得到了加速,但整体端到端收益受限于未被加速的视觉编码和预填充阶段。

💡 Main Points

极低开销实现显著的推理加速

DSpark 草稿模型在设备端实现了高达 3.13 倍、在 H100 上实现了 2.66 倍的解码加速,而仅为 3B 目标模型增加了 280M 参数(约 8.9% 的增幅)。

多模态投机采样的统一架构

草稿模型在抽样层捕捉目标模型的隐藏状态;由于图像分块和文本 Token 被投影到共享表示中,无论输入模态如何,草稿模型的运行方式均保持一致。

广泛的生态系统兼容性

此次发布立即支持包括 llama.cpp、MLX-VLM 和 SGLang 在内的流行推理框架,方便在不同硬件上快速部署。

Amdahl 定律限制了 VLM 的端到端收益

投机采样仅加速解码阶段。在 VLM 中,视觉编码和预填充阶段(尤其在边缘设备上)占据了总延迟的大部分,从而限制了整体端到端的加速比。

💬 Key Quotes

它增加了一条投机采样路径,用极小的内存占用增加换取更大的速度提升,且不改变输出质量。

投机采样仅加速解码,而非视觉编码或预填充。

这就是 Amdahl 定律,整体加速比受限于工作负载中未被加速的部分。

投机采样是精确的:目标模型会验证每一个建议的 Token,因此贪婪输出与仅使用目标模型的结果完全一致。

📊 Article Meta

AI Screening: 86

Source: Hugging Face - Blog

Author: xx, Yuri Khrustalev, Leonie Monigatti, Viviana Márquez

Category: 人工智能

Language: 英文

Read Time: 4 min

Word Count: 868

Tags:

AI 与智能应用 , 性能优化 , 视觉语言模型 , 开放权重模型 , LLM 推理优化

#AI 与智能应用# 性能优化# 视觉语言模型# 开放权重模型# LLM 推理优化

文章评论(0)

暂无评论,快来抢沙发~