GLM-5.3 对比 Claude Fable 5:904 次实测首战打平,5.4 倍价差才是决定性因素
一句话结论
首次尝试是统计意义上的平局,5.4 倍的价格差距决定了其余一切。
GLM-5.3 和 Claude Fable 5 在 DeepSWE 准确率上差距落在误差线以内,但 GLM-5.3 每个任务成本只有五分之一,并赢下所有多次尝试指标。当两个模型质量如此接近时,价格差距就是整个决策。

关键要点
- 首发打平。Fable 5 的 pass@1 为 69.7%,GLM-5.3 为 69.0%,0.7 个百分点的差距在双方误差线之内。
- GLM-5.3 赢下重试。它领先 pass@2(81.1% 对 77.1%)和 pass@4(87.6% 对 84.1%),所以它既有更高的能力上限,又有更低的价格。
- 成本差距 5.4 倍。每次 rollout $3.99 对 $21.63。每 $100 花费,GLM-5.3 解决 17 个任务,Fable 只解决 3 个。
- 两者近似替代品。逐任务相关度 0.65 是本组最高,同时跑两个增加的覆盖很少。保留低成本的模型,只在 Rust 和序列化工作上升级到 Fable。
实验设置
这是 Together 在 DeepSWE 上做的 GLM-5.3 与 Claude Fable 5 对比。DeepSWE 是一个跨多种任务类型和编程语言测试模型软件工程能力的基准。两个模型几乎无法在质量上分开:Fable 5 的 pass@1 领先 0.7 个百分点,同时每次 rollout 成本是 5.4 倍,是整个 DeepSWE 榜上最贵的配置。这让有意思的问题变得很窄:准确率相同时,这笔溢价到底买到了什么?
| 模型 | pass@1 | 平均成本 | 每 $100 解决 | 输出 token | 步数 |
|---|---|---|---|---|---|
| glm-5.3 (max) | 69.0% ± 2.7% | $3.99 | 17 | 80k | 124 |
| claude-fable-5 (max) | 69.7% ± 2.3% | $21.63 | 3 | 114k | 85 |
在 DeepSWE 全部 113 个任务上,两个模型各跑 4 次试验(均开最大努力档),基于公开逐试验记录共 904 次 rollout,每个模型 452 次。两者都属于纪律性强、低回归的流派,所以行为非常相似。以下所有数字都来自这一轮实测,可能与其它公开的 GLM-5.3 对 Claude Fable 5 记分卡不同。
计分板:pass@1 与 pass@k
单发是平局。Fable 5 按 DeepSWE 官方计分首发解决 69.7% 的任务,GLM-5.3 解决 69.0%,差距远在噪声带之内。一旦允许重试,两个模型就分开——且向 GLM 倾斜。两次尝试时 GLM-5.3 以 81.1% 对 77.1% 领先;四次尝试时以 87.6% 对 84.1% 领先。

开源模型以零头的价格匹配了 Fable 的首发准确率,并且在允许重试后持有更高的上限。不存在任何一个尝试次数,让为 Fable 支付 5.4 倍价格能买到更多覆盖。
成本对比
每次 rollout $3.99,GLM-5.3 比 $21.63 的 Fable 便宜 5.4 倍:每 $100 解决 17 个任务对 3 个。Fable 是榜上最贵的配置,而这个价格并没有给 GLM 带来速度惩罚:GLM-5.3 平均每次 rollout 35 分钟,Fable 34 分钟,基本持平。
token 画像解释了这轮运行的形态。GLM-5.3 是更不啰嗦的模型(输出 80k token 对 Fable 的 114k),尽管步数更多(124 对 85)。Fable 每步写得更多,GLM 步数更多且每步更便宜。两者都不算快,但只有一个的成本是五分之一。

覆盖率与可靠性
把 pass@1 分解为覆盖率(至少解过一次的任务比例)和可靠性(这些任务上的通过率),两者落在平面的几乎同一个角落,GLM 略微更远。GLM-5.3 的覆盖率更高,87.6% 对 84.1%;Fable 每次尝试略稳,可靠性 82.0% 对 78.8%,并且 4/4 全过的任务更多(56 对 48)。
实践中两者都像纪律性强的通才,GLM 用一小片每次尝试的可靠性换取了明显更宽的触达范围。
失败模式
这是两模型家族相似性最明显的地方。两个模型都只在 11% 的失败中回归现有测试套件,远低于 GPT 家族的 20%,所以两者都可以在没有重回归门的情况下安全接受。
差异很小。Fable 的大失误占比更高(18% 对 GLM 的 16%),意味着它出错时更容易错得离谱。GLM 以近失误失败的比例略高(61% 对 57%)。总体上,两者以同样的纪律方式失败,这正解释了为什么它们的结果如此相关。

按任务类型谁赢
尽管 pass@1 打平,领域地图并不相同。GLM-5.3 拿下结构化、解释器风格的工作:查询与配置(88 对 72)、语言与运行时内部(83 对 78)、有状态响应式(73 对 64)、并发与持久性(62 对 45)、程序分析(64 对 56)。并发这个结果是 Fable 最弱领域里的 17 分差距。
Fable 用精确契约领域回应:数据建模与序列化(88 对 79)、构建与运维(71 对 68)、协议一致性(55 对 44)——这是 GLM 最弱的区域。GLM 赢五个领域,Fable 赢三个,Fable 在并发上的 45% 是唯一应该完全避开它的赛道。

按编程语言谁赢
Fable 的理由几乎完全建立在一门语言上:它的 Rust 是 85% 对 GLM 的 70%,15 分的差距是这次对决中最宽的单语言差距。序列化密集的工作是这个优势的天然伴随。
GLM 用榜上最好的 JavaScript 回应(90 对 75),Go 接近平手(76 对 71),TypeScript(61 对 57)。Fable 守住 Python(70 对 66)。在 Rust 和序列化密集工作之外,没有任何语言让 Fable 的 5.4 倍溢价买到有意义的准确率优势。

两模型有多相似
这是想同时跑两个模型的人要注意的陷阱。GLM-5.3 与 Fable 的逐任务相关度是 0.65,是本组中任何配对里最高的一致性。两者都解出 88 个任务。GLM 独得 11 个,Fable 独得 7 个,7 个战胜两者,没有任何方向上的四比零分歧。
它们的并集覆盖 113 个任务中的 106 个(93.8%),但因为它们在很大程度上的同样任务上成功和失败,配对它们比把任一者与 GPT 家族模型配对增加的多样性更少。它们是近似替代品,而当两个模型互相替代时,你保留成本更低的那个。

级联路由:组合玩法
如果确实要两个都跑,顺序和经济性仍然偏向把开源模型放前面。先跑 GLM-5.3,只在测试套件拒绝答案时升级到 Fable:81.1% 解决率、每任务 $10.74。这比 Fable 单独(69.7%)高 11 个百分点,价格只有 Fable 自身每任务价格($21.63)的一半。

考虑到 0.65 的相关度,诚实的建议更简单:对大多数工作,GLM-5.3 单独就能以五分之一的成本捕获 Fable 几乎所有的能力,Fable 只在它的 Rust 和序列化专长上值得升级。
完整数据表
| 指标 | GLM 5.3 (max) | Fable 5 (max) |
|---|---|---|
| pass@1(官方计分) | 69.0% | 69.7% |
| pass@1(错误计为失败) | 68.8% | 67.3% |
| pass@2 / pass@4 | 81.1 / 87.6% | 77.1 / 84.1% |
| 覆盖率 / 可靠性 | 87.6 / 78.8% | 84.1 / 82.0% |
| 稳(4/4)/ 墙(0/4) | 48 / 14 | 56 / 18 |
| 每次 rollout 成本 / 总成本 | $1,806 | $21.63 / $9,346 |
| 每 $100 解决任务数 | 17 | 3 |
| 平均分钟 / 步数 | 35 / 124 | 34 / 85 |
| 平均峰值上下文 / 输出 token | 155k / 80k | 205k / 114k |
| 失败解剖(近失误/大失误/回归) | 61% / 16% / 11% | 57% / 18% / 11% |
| 赢得领域数(共 8) | 5 | 3 |
| 赢得语言数 | 2(JavaScript、TypeScript) | 3(Rust 大胜、Python、Go) |
| 逐任务相关度 / 并集 | 0.65 / 106 of 113(93.8%) | |
| 级联 GLM→Fable(准确率/成本) | 81.1% / $10.74(对比 Fable 单独 69.7% / $21.63) | |
| 单发预言机路由 | 78.5% | |
| 基础设施错误 | 1 | 16 |
113 个 DeepSWE 任务 × 每配置 4 次试验 × 均开最大努力 × 共 904 次 rollout。
方法与注意事项
- 数据:DeepSWE v1.1 导出,113 任务 × 每配置 4 次试验,均开最大努力,来自公开逐试验记录,每方 452 次试验。
- 计分:头条通过率使用 DeepSWE 官方计分(计入 included_in_score,排除基础设施错误)。Fable 有 16 个来自模型路由的基础设施错误,所以它的严格错误计为失败分数是 67.3 对官方的 69.7。GLM-5.3 只有 1 个。
- pass@2、pass@4、覆盖率、并集和相关度使用逐任务通过计数。
- 成本是公开的逐试验 cost_usd。Fable 的与轨迹 total_cost_usd 完全匹配,GLM 的是仅索引值。GLM-5.3 批次的逐轮轨迹 JSON 在分析时不在公开 CDN 上。
- 失败解剖使用公开的逐测试分数。近失误指至少 80% 的新测试通过且基线完好。回归指基线测试被破坏。领域使用基于工件的任务分类法。
- 级联假设验证器决定升级和给定任务的独立性。期望准确率对顺序对称,成本不对称,所以用低成本模型打头。鉴于 0.65 的相关度,组合收益有限。预言机路由是逐任务最佳单发选择,是任何单发路由器的上界。
部署建议
- 默认选 GLM-5.3:统计平局的首发准确率、全部重试指标领先、5.4 倍价格优势,五个领域加榜上最好的 JavaScript。
- 只在两个场景升级 Fable:Rust 密集(85% 对 70% 大幅领先)和序列化关键任务(88 对 79)。
- 不要同时跑两个当组合:0.65 相关度意味着组合收益有限;省下的预算投给 GPT 家族模型做差异化补充更值。
原文信息
- 作者:Together AI
- 发布时间:2026-08-21 原文地址:
刚好最近在找这方面的资料,太及时了。
看标题就点进来了,内容果然没让人失望。
整理得太全面了,省了我不少时间。
刚好最近在找这方面的资料,太及时了。
楼主辛苦了,内容很有参考价值。
看完了,收获满满,期待更多更新。
支持作者,持续关注中。
整理得太全面了,省了我不少时间。
讲解得很细致,新手也能看懂。
赞同,实践出真知。