最好的模型路由是任务特定的:Jerry Liu 讲透省钱与准确率的两层架构

林知秋AI 前沿📡 觉醒AI2026-09-201416 阅读💛 95 收藏

模型路由是当下最热的话题。过去一个半月里,OpenRouter 发布了 Fusion——把你的一条提示词同时分发给一组前沿模型、再合成一个答案的复合模型;Cognition 发布了 Devin Fusion——让一个前沿模型和一个便宜的”副手”模型并行运行、用分类器在两者之间切换的执行框架;Factory 的路由器在 Terminal-Bench 2 上以低 20% 的成本保住了 Claude Opus 4.7 约 99% 的通过率;连 Vercel 都开始在它的 AI 网关里提供路由规则。最近 ShortcutAI 还发文展示了如何调校执行框架与模型组合,造出一个比 Claude for Excel 准确率更高、token 消耗更低的电子表格智能体。

这些产品的宣传收敛于同一个模式:没有人想为每个 token 支付前沿价格。

我认为这个趋势是真的。在此之上我想补充:最好的路由是深度任务特定的,你对单一工作流聚焦得越窄,在准确率和成本上能挖掘的超额收益(alpha)就越大。你不需要为每个任务都配备前沿智能——但”哪个模型跨过了哪个任务的门槛、同时满足你的成本与延迟约束”,这个问题只有对那个任务痴迷的人才能回答。

模型智能是锯齿状的,什么算”够好”(以及你愿意为最后几个点的准确率付多少钱)完全取决于任务。一个不了解你任务的路由器,在这两件事上都只能瞎猜。

成本故事:通用路由器为什么不够

前沿模型在大规模场景下逐 token 运行太贵了——像 Fable 这样的模型在放量时一小时能烧掉 600 美元推理费,而大多数工作并不需要这种马力。成本曲线帮了忙:在曲线顶部附近,成本急剧下降而质量几乎不动,因为最先离开前沿模型的那些工作,换个便宜模型干得一样好。Factory 就跑在这段平坦区上,在通过率持平的情况下省出 20-25% 成本;宣称”用一个模型干所有活的时代正在结束”的 Cognition Devin Fusion,以低 35% 的成本维持 Fable 5 级别的性能,其用户合并的 PR 里有 88% 直接来自路由器。

OpenRouter 在这件事上确实出色,Fusion 发布时我就这么说过。但 Fusion 是一个为”困难、开放式问题”最大化质量而构建的集成方案——在这类问题上你会愿意付几份模型调用的钱,因为答错的代价很高。任务特定路由回答的是另一个问题:**给定这个具体输入,满足这个任务质量门槛的最便宜路径是什么?**通用网关可以跨供应商路由、在某个端点劣化时切换,但它不知道你扫描的贷款文件第 3 页是一张需要专用视觉模型的密集表格、而第 1-2 页是应该用廉价直提工具抽取的纯文本。它对你的输入没有建模,因为它不以任何单一任务为业。

路由做得好的团队,都往单一工作流深处走

编程智能体只是声音最大的例子。看看那些在交付严肃垂直 AI 产品的团队,你会发现同一个模式:每家都在单一工作流内部路由,每家都对任务理解足够深、知道哪个模型跨过了门槛。

法律领域的 Harvey 是最干净的案例。他们的多模型系统把一个请求拆成子任务、为每个子任务选模型、再合成结果——“没有单一模型在所有事上都是最好的”,所以他们把高并发的 Vault 工作路由到 Sonnet 4.6 和 Gemini 3 Flash 这类延迟低、质量够用的更快的模型,同时对自己后训练的开源模型做调优,以更低成本逼近前沿级法律性能。

客服领域的 Decagon 做同样的事,Jesse 的表述是我读过的最锐利版本:当一个用例还新的时候你要最聪明的通用模型,但”一旦用例完全成型……通用智能就是开销”,你要的是”最小、最快、针对你的具体事情微调到极致的模型”。Decagon 现在约 90% 的工作负载跑在微调过的开源模型上。

这两家都不是抓一个模型然后祈祷。每家都在用一组自己深度理解的模型组合对单一任务做爬山优化,而这种理解正是通用路由器买不到的东西。这是 Sarah Guo 那篇《Untrainable》最具体的体现:难度模型和给它打分的评估体系,是从真实业务量里挣来的私有事实,下个季度更聪明的前沿模型不会白送给你。超额收益就在这里,而且会复利。

文档 AI:差距很大,而且会一直很大

很多人假设前沿模型会彻底吞掉文档解析。没有。在我们开源的 ParseBench 上,前沿视觉语言模型擅长视觉理解、却在版面布局上很差——GPT-5-mini 和 Haiku 在视觉定位上得分低于 10%,而专用解析器落在 55-80%,且没有任何单一方法在全部五个维度上称王。Gemini 从最小思考档提到高思考档能涨约 5 个点,成本翻 4 倍,而你还在那些根本不需要视觉模型的纯文本页上燃烧视觉 token。

文档 OCR 的正确架构是一个复杂的”路由器”(更准确说是一台复杂引擎),许多部件协同运转、针对特定数据域和任务分布精心调校。LlamaParse 的底层就是这么做的:一个智能体执行框架在每个页面前沿模型与专用模型之间自动路由,配上一个自我改进的文档复杂度模型;自定义文档引擎在纯文本场景砍掉 50-90% 的视觉 token;针对表格和图表后训练的专用视觉模型;以及一个验证输出的智能体裁判。在成本-准确率平面上它落在前沿上——智能体模式以 84.9% 领先并赢下五个维度中的四个,高性价比模式以每页约三分之一美分落在近顶部。

相对前沿模型的视觉能力,文档理解的前景曲线上会永远存在巨大缺口。我们把 LlamaParse 设计成永远最擅长利用这个缺口的产品。

两层架构,各司其职

这两层最终沉淀成不同角色。OpenRouter 这类通用网关负责宽泛的供应商级路由与集成(哪些模型在线、此刻哪家最便宜、什么时候该为一个困难的通用问题召集模型小组)。任务特定层则是超额收益所在,而且收益归属于在工作流上钻得最深的人:软件工程归 Factory 和 Cognition,法律归 Harvey,客服归 Decagon。文档这件事,我们打算让它归我们。如果你正在为前沿模型和开源视觉语言模型做路由、想从每一分钱里榨出文档准确率的每一个点,欢迎来和我们一起构建。

原文信息

作者:Jerry Liu(@jerryjliu0),LlamaIndex 创始人 原文地址:

文章评论(0

暂无评论,快来抢沙发~