怎么做好 Knowledge Agents?不应该复制 Coding Agents,做好检索能力…
一句话用途
这篇解读了 Ben Clavié 关于 Knowledge Agents 的演讲:为什么编程智能体的成功范式不能直接搬去做法律、医疗、投研这类知识工作,瓶颈在检索工具质量与主/子智能体分工,末尾给了企业落地建设的优先级清单。想在企业场景做知识型 Agent 的用户可以按这篇的优先级排序资源。
Ben Clavié @bclavie 在 AI Engineer World’s Fair @aiDotEngineer 的演讲,主题是 “Agents should do Knowledge Work, so they should be Knowledge Agents”
核心结论
复杂知识工作的瓶颈,不只在模型能力,在于“检索工具是否足够好”与“系统是否能合理分工”。
Ben 反对把 AI Agent 理解成一个能独立完成所有事情的“全能个体”。他的主张是:若要让 AI 真正服务法律、医疗、咨询、投研、企业文档等知识密集型场景,系统应同时具备两种能力:
- 高质量、面向任务的检索工具:让 Agent 找到正确、完整、可追溯的信息,尤其包括图表、扫描件、多文档关联等非纯文本内容。
- 编排与分工能力:由主智能体理解需求、拆解任务,再让不同子智能体或工具执行检索、核验、计算、归纳,最后汇总并对结果负责。
演讲逻辑
时间内容真正含义00:00–03:52从 RAG 到 Coding Agent 的演化编程智能体成功,不代表它是所有知识工作的通用范式。03:53–05:55代码与一般知识的差异代码有明确变量、目录、测试与任务单;法律、商业和医学信息高度依赖语境。05:56–07:59人类知识工作的演化知识生产始终沿着两条线升级:工具更强,组织分工更细。08:00–11:08检索工具决定上限检索不是可替换的插件;低质量搜索会迫使模型反复试错、浪费上下文和调用次数。11:09–15:13主智能体 + 专家子智能体复杂知识任务更像律所、医院或咨询团队,而不是一个人从头做到尾。
最值得理解的三个观点
第一,代码智能体的成功有其“环境红利”。 代码库通常具有较强结构:函数名、文件路径、类型定义、测试反馈和工单描述都提供了稳定线索。相比之下,“合同中 30 天”究竟指付款期限、宽限期还是数据保留周期,必须结合上下文、主体、条款关系和业务目的判断。视频借此指出:知识任务的难点不是生成文字,是正确定位、理解和验证证据。
第二,检索质量会改变任务是否“做得成”,而不只是做得快。 视频的关键判断是:若 Agent 总是检索到噪声、缺页、错误版本或只有文本而没有图表的信息,后续推理再强也会建立在错误证据上。BrowseComp-Plus 的研究正是为了把“模型推理能力”和“检索器质量”分开评估;其论文显示,更强的检索器可以显著提升深度研究 Agent 的准确率,并减少搜索调用次数。〔〕 因此,企业不应只问“换一个更强模型是否有效”,还应问:它能否检索到正确粒度、正确版本、正确模态的信息?
第三,多智能体的价值不在“智能体数量”,而在“职责清晰”。 讲者用律所作类比:合伙人负责理解客户问题、设定判断标准并承担最终责任;助理负责查找案例、提取证据、撰写备忘录。映射到 AI 系统,就是:
主智能体负责意图澄清、任务分解和最终综合; 子智能体或专业工具负责检索、图表理解、事实核验、计算及证据归档。
这比单个 Agent 一路搜索、一路写答案更接近真实知识工作的组织方式。
对视频数据的客观判断
视频中提到 BrowseComp-Plus 和 MADQA 的结果,支持“工具与架构会显著影响 Agent 表现”这一方向性结论。BrowseComp-Plus 使用固定、人工核验的约十万篇文档语料,目的就是避免动态网页搜索带来的不可复现问题。MADQA 则以 800 份异构 PDF 和 2,250 个问题,测试 Agent 对文本、视觉信息与多页证据的处理能力。
但应注意两点:
- 演讲中展示的 90.2%、82%、3.5% 等数字,属于特定模型、检索器、提示词、任务预算和评测设置下的结果,不能直接等同于生产场景中的通用收益。Mixedbread 当前公开页也展示了相近但不完全相同的 BrowseComp-Plus 数值,说明版本与评测配置会影响结果。
- 讲者来自检索产品公司,因此其“检索是关键杠杆”的立场有明确产品视角;但这并不削弱论点本身。更合理的结论是:检索、模型、工作流和评测必须被视为一个系统,而非只优化其中一个环节。
对实际工作的启示
若要建设企业级知识 Agent,优先级应是:
- 先定义可验证的业务任务:例如“找出合同续约风险并引用条款”,而不是泛泛地“分析所有合同”。
- 先建设证据层:权限、版本、元数据、OCR、表格/图像解析、引用定位与来源追溯。
- 再决定是否拆分智能体:只有任务可并行、需要不同专业能力或涉及多类数据时,多智能体才值得其额外成本。
- 以准确率、证据完整性、成本、延迟和人工复核率共同评估,而不是只看回答是否流畅。
- 在高风险领域保留人类最终审阅与责任链条;多智能体不能替代合规、授权边界和专业判断。
一句话评价:这个演讲在提醒开发者,真正可用的知识型 AI,不是更会说话的单一模型,是能以合适工具找到证据、按合适分工完成判断、并能说明依据的系统。
原文信息
- 作者:少盟(@shao__meng),AI Agent 工程观察者
- 原文标题:怎么做好 Knowledge Agents?不应该复制 Coding Agents,做好检索能力… 原文地址:
暂无评论,快来抢沙发~