伯克利实测:换个智能体外壳,同款模型成本直降 71%,毛利从 38% 变 75%
一句话结论
伯克利本周发布的 HarnessTax 研究给出了一组硬数据:同一个模型换一个智能体外壳(harness),完成同样任务的推理成本最多相差 71%,而 42 组同模型对比里没有一组质量差异具有统计显著性。对用 AI 做产品的团队,这意味着选外壳和选模型一样直接影响成本结构——外壳越好,毛利越高。
什么是智能体外壳
外壳是控制 AI 智能体行为的系统:提示词怎么组织、工具怎么调用、流程怎么编排,都由它决定。模型负责思考,外壳负责指挥。同一个模型装进不同的外壳,跑同样的任务,账单可能差出好几倍。
伯克利的研究设计
研究覆盖 21 组「模型 × 外壳」组合,每组在 SWE-bench Lite 和 Terminal-Bench 2.0 上各跑 30 个任务,每个任务尝试 3 次,按 2026 年 9 月 1 日的固定价格表计费。研究者对全部 42 组同模型跨外壳对比做了双侧 Fisher 精确检验,只有一组达到 p<0.05——而纯凭运气也预期出现约两组。经 Holm-Bonferroni 校正后,没有一组质量差异成立。
研究也坦承两点局限:公开的 rollout 按成本排序,破坏了任务配对,导致无法做配对检验;每个单元格 90 次 rollout 的样本量,只能检测约 15 个百分点的摆动。换句话说,质量差距在这个样本量下是「未被证明」,不是「被证明不存在」。
71% 是怎么来的
最具代表性的一组对比:GPT-5.6 Sol 从 Claude Code 换到 Pi,每个已解决任务的成本从 1.540 美元降到 0.441 美元——模型没变、结果一样,成本降 71%。这是全文论证的实测支点。
两家初创的毛利对照实验
Tunguz 用一个假想场景把研究结论换算成生意语言:Theory 风投要买一份 25 万美元/年的「AI 分析师」合同,评估 5000 家公司,两家初创竞标。
- Inferno:每一步都直接调用最前沿模型。推理成本 13.1 万美元,加上托管、评测和人工审核共 2.5 万美元的其他成本后,毛利 38%。
- Inferefficient:用外壳把常见工作流凝固成确定性代码和技能,只把少数真正需要强推理的步骤留给贵模型。推理成本 3.7 万美元,毛利 75%。
收入相同,成本结构不同,一个是软件生意,一个不是。
为什么 Inferno 抄不了作业
把任务路由给便宜模型的前提,是你确切知道哪些任务它做得对。这个知识来自看过上万次同类工作——Inferno 没有这个积累,抄不了。成本优势和护城河是同一份资产。
超过 8600 次评估后,Inferno 每多做一次就亏一次,只能限制客户用量——恰恰在客户最需要产品的时刻变成更差的产品。Inferefficient 则来者不拒。毛利买来增长:一份 15 万美元获客成本的合同,Inferno 要 19 个月回本,Inferefficient 只要 10 个月;一边可以以两倍速度招人,一边不能。
有效外壳的三要素
Tunguz 总结有效外壳不靠奇门偏方,靠三件事:对客户的深度理解、一套与业务相关的评测集(evals)、一座自动爬山(hill climbing)的工厂。把这三样做扎实,就是一家有价值、可防守的软件公司。
原文同时提醒:毛利不会无限逼近 100%。推理越便宜,买家就要求智能体干越多的事,竞争会把均衡点推着走。但两家公司之间的差距会持续存在——差距本身就是生意质量。
给 AI 应用团队的选型启示
把这份研究翻译成可操作的判断:第一,换外壳是比换模型更便宜的成本杠杆,值得先试;第二,质量无显著差异不等于随便选,样本量只能检测 15 个百分点级别的摆动,小差异测不出;第三,评测集不是锦上添花,它是你敢把任务路由给便宜模型的知识来源,也是毛利护城河本身。对自建 AI 工作流的团队,从第一天起就积累自己的评测集,等于同时在积累成本优势。
原文信息
原文地址:
- 原文标题:The Harness Margin Opportunity
- 作者:Tomasz Tunguz(@tomtunguz),Theory Ventures 风险投资人
- 发布时间:2026-09-17
有没有更详细的教程,期待后续。
很有价值的分享,感谢整理。
这个观点很中肯,深有同感。
这个比较实用,已转发给同事。