蒸馏 LLM,不要直接 Serving:DoorDash 搜索与个性化实践 — Raghav Saboo,DoorDash

📌 One-Sentence Summary
DoorDash Staff ML 工程师 Raghav Saboo 指出,市场平台发现的本质是语义理解问题,并展示如何将 LLM 推理离线蒸馏为分级监督、Semantic ID、消费者记忆与可驾驭内容生成四类共享原语,让传统检索与排序系统在十亿级条目规模下低成本 Serving。
📝 Summary
DoorDash 搜索与个性化团队的 Staff 机器学习工程师 Raghav Saboo 开篇主张:市场平台发现的瓶颈在于对商品含义与购物者意图的语义理解,而非单纯优化互动。他介绍了四类由 LLM 支撑的共享原语,覆盖餐厅、杂货、零售、宠物与礼品等扩展品类。监督标注从人工 0/1/2 相关性种子起步,用更强 LLM 与 taxonomy 模型审计冲突,微调如 GPT-4o mini 等轻量标注器,再离线标注全量目录,使分级相关性成为检索与排序的共享目标。这些标签训练两阶段对比学习检索器,挖掘难负样本,将相关性 NDCG 提升 2.3%,并在互动塔旁增设序数相关性塔,使各表面可权衡契合度与业务目标。Semantic ID 以层次化编码替代粗粒度 taxonomy,覆盖数十亿店-品条目,将排序 MRR 提升 4–5%,改善冷启动与长尾覆盖,并支撑目录锚定的查询改写。消费者记忆将长期、实时与显式偏好沉淀为可检视的记忆块,物化为文本、向量与上下文图,供 Ask DoorDash 与下游模型使用。可驾驭离线生成把记忆与 Semantic ID 转化为个性化店铺合集,宠物垂类早期实验显示订单率约提升 1%、活跃用户约提升 6%。收束论点是:把 LLM 推理蒸馏进原语,而不是把在线 LLM 调用当成产品架构。
💡 Main Points
市场平台发现本质是语义理解问题
仅靠互动排序难以满足无麸质意面等约束强意图;LLM 能对商品含义与跨会话、跨品类的购物任务提供可规模化的推理。
昂贵 LLM 推理只做一次离线,再蒸馏落地
PIP 管线先种下 0/1/2 分级标签,用更强 LLM 与 taxonomy 模型审计冲突,微调轻量标注器后全量离线标注,使检索与排序共享同一廉价目标。
两阶段对比检索与序数相关性塔吸收标签信号
难负样本课程式训练将相关性 NDCG 提升 2.3%;共享底层的序数塔与点击、加购、转化头并列,各表面可重新权衡契合度与互动。
Semantic ID 与消费者记忆是可复用的目录与用户原语
覆盖数十亿店-品的层次化 Semantic ID 将 MRR 提升 4–5%,改善冷启动与查询改写;长期、实时与显式偏好的记忆块同时供给 ML 模型与智能体场景。
可驾驭离线生成把原语变成个性化合集
离线 LLM 基于记忆与 Semantic ID 合成消费者级合集标题与条目,再复用现有检索与排序栈;宠物垂类测试显示订单率约高 1%、活跃用户约多 6%。
💬 Key Quotes
先抛一个简单判断:在 DoorDash 这类市场平台上,有效发现的真正瓶颈是语义理解。
对我们很重要的模式是:昂贵推理只做一次离线,再蒸馏进能低成本、低延迟 Serving 的模型。
我们不是用 LLM 替换检索与排序系统,而是把推理与理解蒸馏进生产排序架构。
在线 LLM 调用往往并不是你真正需要的产品架构。
把推理离线沉淀为标签、Semantic ID 与记忆,再让更小、更快的模型去 Serving。
📊 Article Meta
AI Screening: 90
Featured: Yes
Source: AI Engineer
Author: AI Engineer
Category: 人工智能
Language: 英文
Read Time: 9 min
Word Count: 2245
Tags:
AI 与智能应用 , 推荐系统 , 大语言模型 (LLM) , 平台经济 , 机器学习
Play Full Video
点赞,必须点赞
内容翔实,正好需要,先收藏再看。
看标题就点进来了,内容果然没让人失望。
不错不错,已加入书签。
这个比较实用,已转发给同事。
看标题就点进来了,内容果然没让人失望。
楼主辛苦了,内容很有参考价值。
路过
收藏了,以后慢慢研究。
这篇文章分析得很透彻,收藏了!
整理得太全面了,省了我不少时间。
写得挺用心的,支持一下。