Constella 预览:无需重新嵌入即可切换查询模型 - Qdrant

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-09-29376 阅读💛 28 收藏
Constella 预览:无需重新嵌入即可切换查询模型 - Qdrant

📌 One-Sentence Summary

Qdrant 推出 Constella,这是一系列非对称嵌入模型,允许用户在不重新对文档集合进行嵌入的情况下切换查询编码器(Zero、Nano 或 Stella),从而优化检索质量与计算成本之间的权衡。

📝 Summary

Constella 是 Qdrant 推出的一个研究预览版,包含一组基于 400M 参数 Stella 嵌入模型构建的模型。虽然文档仅使用 Stella 编码一次,但查询可以由 Stella、Nano(一个 34.5M 参数的 Transformer)或 Zero(一种学习到的词袋模型)处理。这种架构实现了「可热插拔」的查询模型,使开发者能够大幅降低查询端的延迟和计算成本——其中 Zero 比完整的 Stella 快多达 480 倍——同时保持相当高的检索准确率。文章提供了在 15 个 BEIR 数据集上的性能基准测试,并建议了实际应用场景,例如低功耗设备上的离线搜索和「边输入边搜索」界面。

💡 Main Points

非对称查询-文档编码架构

Constella 将文档编码器与查询编码器解耦。通过训练 Zero 和 Nano 以复现 Stella 的嵌入,Qdrant 允许按请求更改查询模型,而无需重新索引整个文档集合。

用于计算-质量权衡的三层模型层级

该系列提供三种选项:「Zero」(最小计算量,无词序信息)、「Nano」(小型 Transformer,具备上下文感知能力,保留约 91% 的 Stella 平均得分)以及「Full Stella」(最高准确率,最高计算量)。

显著降低查询端延迟

在 Apple M5 Pro CPU 上的基准测试显示速度大幅提升:Full Stella 每次查询耗时 38.95ms,Nano 耗时 3.13ms,而 Zero 仅需 0.081ms,使其适用于高吞吐量 API 和边缘设备。

在混合搜索和实时搜索中的实际应用

作者建议将 Zero 模型与 BM25 结合用于混合搜索,以在不增加 Transformer 开销的情况下提升相关性;并采用分层方法(按键入使用 Zero,提交时使用 Nano)来实现「边输入边搜索」功能。

💬 Key Quotes

Constella 让你能够进行这种切换。它是 Hugging Face 上围绕 Stella(一个 400M 参数的英语嵌入模型)构建的一系列模型。

我们训练 Zero 和 Nano 以复现 Stella 的查询嵌入。这就是这些模型可以热插拔的原因:你可以按请求更改查询编码器,而存储的文档向量保持不变。

在所有 15 个数据集中,Nano 保留了完整 Stella 平均得分的约 91%,且其查询 Transformer 要小得多。

📊 Article Meta

AI Screening: 88

Source: Qdrant - Vector Search Engine

Author: Dylan Couzon

Category: 人工智能

Language: 英文

Read Time: 6 min

Word Count: 1256

Tags:

AI 与智能应用 , 向量数据库 , 模型蒸馏 , AI 工程 , RAG / 检索增强

#AI 与智能应用# 向量数据库# 模型蒸馏# AI 工程# RAG / 检索增强

文章评论(0)

暂无评论,快来抢沙发~