如何在 Harness 中构建模型路由器

📌 One-Sentence Summary
LangChain 在 Open SWE 智能体 Harness 内构建了模型路由器,对每项任务进行分类并选择最低成本的合适模型,将编码线程的中位数成本降低了 64%,且质量变化可忽略不计。
📝 Summary
前沿 LLM 成本高昂,大多数智能体任务并不需要前沿智能。LangChain 描述了为其开源编码智能体 Open SWE 构建模型路由器的过程——该路由器存在于 Harness 内而非通用网关,因为路由需要 Harness 已经整合的任务与领域上下文。团队首先分析了一周的 LangSmith 跟踪记录,绘制了任务类型(功能开发占 22%、漏洞修复占 17%、测试占 16%)及复杂度分布,随后沿成本-智能 Pareto 前沿选择了三款模型:一款快速开源模型、一款均衡模型和一款性能模型。路由器在线程的第一条人类消息上使用基础提示词、每层标准和分类器模型运行。在对 973 个线程进行的 A/B 测试中,对比始终使用最强模型的控制组,合并 PR 比率统计学意义平坦(29.2% 对 27.3%,p=0.49),而线程中位数成本从 2.61 美元降至 0.94 美元,降幅 64%。仅有 10% 的路由线程被分配至性能层级。该文章还讨论了通过合并 PR 和用户反馈进行结果跟踪、于一天内中止的纯快速控制测试,以及深度 SWE 基准测试、子智能体路由、线程中间重新路由等下一步计划。
💡 Main Points
模型路由器应位于智能体 Harness 中,而非通用网关。
选择合适的模型需要领域和任务上下文,Harness 已通过其提示词、工具和领域知识整合这些内容,而通用网关通常缺乏这些。路由器的层级标准专为 Open SWE 的特定任务集编写,与这些任务深度绑定。
路由使编码线程的中位数成本降低了 64%,且无明显质量回退。
在跨 973 个线程的 A/B 测试中,路由线程中位数成本为 0.94 美元,对比始终使用前沿模型的控制组达到 2.61 美元,而合并 PR 比率统计学意义平坦(29.2% 对 27.3%,p=0.49)。平均成本下降 42%,p90 下降 37%,表明节省并非由少数低成本异常值驱动。
大多数任务不需要前沿智能,各层级之间的成本差距悬殊。
路由线程中,56% 分配至均衡层级,34% 至快速层级,仅 10% 至性能层级。线程中位数成本在快速层级为 0.097 美元,均衡层级为 1.50 美元,性能层级为 2.88 美元,30 倍的差距使正确的层级分配成为高杠杆操作。
有效的路由器设计始于可观测性和评估,而非模型选择。
团队首先挖掘 LangSmith 跟踪记录以理解任务类型和复杂度,随后沿 Artificial Analysis 成本-智能 Pareto 前沿选择模型。他们通过合并 PR(更强信号)和稀疏用户反馈跟踪结果,并进行 A/B 测试,因为离线评分 PR 质量困难。
原始路由器是概念验证版,未来改进方向清晰。
路由器每线程仅选一次模型,无法处理线程中的主题或复杂度变化。未来工作包括路由子智能体、线程中间重新路由(权衡提示词缓存损失与收益)、DeepSWE 基准测试,以及挖掘用户情感信息来优化判定标准。
💬 Key Quotes
许多任务不需要前沿智能。
有效的模型路由器应位于 Harness 中,而非通用网关。
有效的路由器设计植根于可观测性和评估。
路由器的价值在于降低成本,但前提是质量不会因此下降。
将路由视为上下文工程,类比于经典的特征工程。
📊 Article Meta
AI Screening: 88
Source: LangChain Blog
Author: Sydney Runkle
Category: 人工智能
Language: 英文
Read Time: 10 min
Word Count: 2294
Tags:
模型路由 , AI 智能体 , Harness 工程 , LangChain , AI 编程
这个观点很中肯,深有同感。
点赞,必须点赞
整理得太全面了,省了我不少时间。
作者写得真不错,学到了不少。
这个比较实用,已转发给同事。
不错不错,已加入书签。
内容翔实,正好需要,先收藏再看。
不错不错,已加入书签。
点赞,必须点赞
刚好最近在找这方面的资料,太及时了。
看完了,收获满满,期待更多更新。
思路清晰,干货满满。