EmbeddingGemma 2:把多模态检索带到端侧

溪行者行业资讯📡 BestBlogs·全站精选⭐ 882026-10-091148 阅读💛 216 收藏
EmbeddingGemma 2:把多模态检索带到端侧

📌 One-Sentence Summary

Google 发布 EmbeddingGemma 2,这是一个 7.4 亿参数的模型,整合了文本、代码、图像、视频和音频嵌入,在其尺寸下实现了最佳性能,支持高效的本地检索与搜索。

📝 Summary

EmbeddingGemma 2 是 Google 推出的一款新型多模态嵌入模型,构建在 Gemma 4 架构上,采用 Apache 2.0 许可证发布。该模型拥有 7.4 亿参数,优化用于本地推理,支持最高 8K token 上下文,并采用 Matryoshka 表征学习实现存储高效的向量截断。在代码、视觉与音频基准测试中均取得顶级成绩,并与 Google AI Edge 工具集成,用于实时决策引擎与多媒体搜索应用。

💡 Main Points

多模态统一

EmbeddingGemma 2 将文本、代码、图像、视频与音频整合到单一嵌入空间,支持跨模态搜索与检索。这对从语音备忘录中寻找特定视频片段或用文本查询搜索音频录音尤为有用。

专为本地端性能优化

模型设计运行在有限资源的消费级硬件上,文本任务仅需约 191MB 活跃内存,完整多模态模型也仅需约 567MB,适合边缘计算应用。

采用 Matryoshka 表征学习(MRL),模型输出向量可动态从 768 维截断至 128 维,实现最多 6 倍的本地向量数据库存储降低,对低存储容量设备管理大型数据集至关重要。

尽管体积小(小于 10 亿参数),EmbeddingGemma 2 在 MTEB Code 与 MAEB 等基准测试中均获得领先分数,在多项任务上可与或超越众多更大模型,表明其性价比极高。

扩展上下文窗口

模型支持 8K token 上下文窗口,是上一代的 4 倍,可在本地硬件上直接处理更长数据序列,如最多 5.5 分钟音频或 29 张图像。

💬 Key Quotes

EmbeddingGemma 2 拥有 7.4 亿参数,最适合本地端推理。

它可以从语音备忘录中寻找特定视频片段,或基于文本查询搜索数小时的音频录音,所有处理由单一原生多模态模型完成。

采用 Matryoshka 表征学习(MRL),开发者可将输出向量从 768 维动态截断至 512、256 或 128 维。

量化后,在 Google Pixel 11 Pro 上,EmbeddingGemma 2 文本任务仅需约 191MB 活跃 RAM,完整多模态模型仅需约 567MB。

支持 8K token 上下文窗口(是 EmbeddingGemma 1 的 4 倍),可在本地硬件上直接处理最多 5.5 分钟音频、29 张图像、58 帧视频或其交替组合。

📊 Article Meta

AI Screening: 88

Featured: Yes

Source: Google DeepMind News

Author: Sahil Dua, Henrique Schechter Vera

Category: 人工智能

Language: 英文

Read Time: 4 min

Word Count: 860

Tags:

AI 与智能应用 , 多模态 AI , 模型发布 , RAG / 检索增强 , 本地与端侧 AI

#AI 与智能应用# 多模态 AI# 模型发布# RAG / 检索增强# 本地与端侧 AI

文章评论(0)

暂无评论,快来抢沙发~