面向边缘设备的多模态 d1 决策模型

📌 One-Sentence Summary
Liquid AI 发布了专为边缘设备优化的开源权重 d1 决策模型(d1-3B 和实验性 d1-omni-600M),在参数量低于 10B 的模型中取得了顶尖基准测试分数,并实现了毫秒级推理延迟。
📝 Summary
Liquid AI 发布了两个新的开源权重决策模型:d1-3B 和实验性的 d1-omni-600M,旨在为边缘设备上的高速结构化决策提供支持。与生成式 LLM 不同,这些模型通过单次前向传播来回答查询,而非逐词生成 token。基于 LFM2.5-VL-3B 骨干网络的 d1-3B 支持文本和图像输入,在七个公开基准测试中平均得分达到 82.9,超越了 Decider 4B 等更大规模的模型。较小的 d1-omni-600M 基于双向编码器构建,增加了音频支持,仅用其四分之一的参数便超越了 Decider 2B。性能指标突显了极高的效率:d1-3B 在 NVIDIA Jetson AGX Thor 上回答问题耗时 16 ms,在 GPU 上则低于 10 ms。这两个模型均已发布在 Hugging Face 上,并提供了使用 `transformers>=5.14` 进行集成的代码示例。
💡 Main Points
d1-3B 在 Decision Index 0.2.1 上得分为 48.57,确立了 10B 以下参数决策模型的新性能标准。
该模型超越了所有测试中的 4B 和 9B 模型,以及规模大得多的 Decider 35B-A3B(得分 47.11),证明了在特定决策任务中,专用架构可以胜过单纯依靠规模扩张。
决策模型与生成式 LLM 存在根本差异,它们通过单次前向传播而非逐词生成来回答问题。
这种架构选择实现了毫秒级的低延迟,使其适用于对速度和资源限制要求严格的边缘硬件实时应用。
这些模型在边缘设备上实现了卓越的推理速度,其中 d1-3B 在 NVIDIA Jetson AGX Thor 上的响应时间为 16 ms。
基准测试显示,在各种 Jetson 设备和 Apple M5 Pro 上响应时间均低于 50 ms,而在 RTX 4090 等高端 GPU 上则低于 10 ms,验证了其在低延迟环境中的适用性。
d1-omni-600M 以显著更小的占用空间提供多模态能力(文本、图像、音频)。
这款基于双向编码器骨干网络的实验性模型在准确率上超越了 Decider 2B,却仅使用了其 25% 的参数,凸显了在受限设备上的高效扩展能力。
💬 Key Quotes
「与我们的生成式模型不同,决策模型不产生 token,而是通过单次前向传播给出答案。」
「d1-3B 在 NVIDIA Jetson AGX Thor 上回答问题耗时 16 ms,在 Jetson AGX Orin 上耗时 26 ms,在 Jetson Orin Nano 上耗时 50 ms。」
「d1-3B 的平均得分为 82.9,是表格中最高的,且超过了 Decider 4B。」
「d1-omni-600M 得分为 78.4,仅用四分之一的参数便超越了 Decider 2B(77.1)。」
📊 Article Meta
AI Screening: 86
Source: Hugging Face - Blog
Author: Aurelien Lac, Fernando Fernandes Neto, Edoardo Mosca, Maxime Labonne, Leonie Monigatti
Category: 人工智能
Language: 英文
Read Time: 4 min
Word Count: 925
Tags:
AI 与智能应用 , 多模态 AI , 模型发布 , 本地与端侧 AI , 开源项目
这个比较实用,已转发给同事。
作者写得真不错,学到了不少。
这篇文章分析得很透彻,收藏了!
实测过类似工具,作者说的基本属实。
思路清晰,干货满满。