面向边缘设备的多模态 d1 决策模型

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-10-081433 阅读💛 40 收藏
面向边缘设备的多模态 d1 决策模型

📌 One-Sentence Summary

Liquid AI 发布了专为边缘设备优化的开源权重 d1 决策模型(d1-3B 和实验性 d1-omni-600M),在参数量低于 10B 的模型中取得了顶尖基准测试分数,并实现了毫秒级推理延迟。

📝 Summary

Liquid AI 发布了两个新的开源权重决策模型:d1-3B 和实验性的 d1-omni-600M,旨在为边缘设备上的高速结构化决策提供支持。与生成式 LLM 不同,这些模型通过单次前向传播来回答查询,而非逐词生成 token。基于 LFM2.5-VL-3B 骨干网络的 d1-3B 支持文本和图像输入,在七个公开基准测试中平均得分达到 82.9,超越了 Decider 4B 等更大规模的模型。较小的 d1-omni-600M 基于双向编码器构建,增加了音频支持,仅用其四分之一的参数便超越了 Decider 2B。性能指标突显了极高的效率:d1-3B 在 NVIDIA Jetson AGX Thor 上回答问题耗时 16 ms,在 GPU 上则低于 10 ms。这两个模型均已发布在 Hugging Face 上,并提供了使用 `transformers>=5.14` 进行集成的代码示例。

💡 Main Points

d1-3B 在 Decision Index 0.2.1 上得分为 48.57,确立了 10B 以下参数决策模型的新性能标准。

该模型超越了所有测试中的 4B 和 9B 模型,以及规模大得多的 Decider 35B-A3B(得分 47.11),证明了在特定决策任务中,专用架构可以胜过单纯依靠规模扩张。

决策模型与生成式 LLM 存在根本差异,它们通过单次前向传播而非逐词生成来回答问题。

这种架构选择实现了毫秒级的低延迟,使其适用于对速度和资源限制要求严格的边缘硬件实时应用。

这些模型在边缘设备上实现了卓越的推理速度,其中 d1-3B 在 NVIDIA Jetson AGX Thor 上的响应时间为 16 ms。

基准测试显示,在各种 Jetson 设备和 Apple M5 Pro 上响应时间均低于 50 ms,而在 RTX 4090 等高端 GPU 上则低于 10 ms,验证了其在低延迟环境中的适用性。

d1-omni-600M 以显著更小的占用空间提供多模态能力(文本、图像、音频)。

这款基于双向编码器骨干网络的实验性模型在准确率上超越了 Decider 2B,却仅使用了其 25% 的参数,凸显了在受限设备上的高效扩展能力。

💬 Key Quotes

「与我们的生成式模型不同,决策模型不产生 token,而是通过单次前向传播给出答案。」

「d1-3B 在 NVIDIA Jetson AGX Thor 上回答问题耗时 16 ms,在 Jetson AGX Orin 上耗时 26 ms,在 Jetson Orin Nano 上耗时 50 ms。」

「d1-3B 的平均得分为 82.9,是表格中最高的,且超过了 Decider 4B。」

「d1-omni-600M 得分为 78.4,仅用四分之一的参数便超越了 Decider 2B(77.1)。」

📊 Article Meta

AI Screening: 86

Source: Hugging Face - Blog

Author: Aurelien Lac, Fernando Fernandes Neto, Edoardo Mosca, Maxime Labonne, Leonie Monigatti

Category: 人工智能

Language: 英文

Read Time: 4 min

Word Count: 925

Tags:

AI 与智能应用 , 多模态 AI , 模型发布 , 本地与端侧 AI , 开源项目

#AI 与智能应用# 多模态 AI# 模型发布# 本地与端侧 AI# 开源项目

文章评论(5)

墨沐雨1 小时前

这个比较实用,已转发给同事。

回复
墨沐雨53 分钟前

作者写得真不错,学到了不少。

回复
林观澜2 小时前

这篇文章分析得很透彻,收藏了!

回复
星寻梦1 小时前

实测过类似工具,作者说的基本属实。

回复
暮临风1 小时前

思路清晰,干货满满。

回复