GLM-5.3 对比 Claude Fable 5:904 次实测首战打平,5.4 倍价差才是决定性因素

山止川行AI 前沿2026-09-16561 阅读💛 282 收藏

一句话结论

首次尝试是统计意义上的平局,5.4 倍的价格差距决定了其余一切。

GLM-5.3 和 Claude Fable 5 在 DeepSWE 准确率上差距落在误差线以内,但 GLM-5.3 每个任务成本只有五分之一,并赢下所有多次尝试指标。当两个模型质量如此接近时,价格差距就是整个决策。

总览:GLM-5.3 vs Claude Fable 5 核心指标

关键要点

  • 首发打平。Fable 5 的 pass@1 为 69.7%,GLM-5.3 为 69.0%,0.7 个百分点的差距在双方误差线之内。
  • GLM-5.3 赢下重试。它领先 pass@2(81.1% 对 77.1%)和 pass@4(87.6% 对 84.1%),所以它既有更高的能力上限,又有更低的价格。
  • 成本差距 5.4 倍。每次 rollout $3.99 对 $21.63。每 $100 花费,GLM-5.3 解决 17 个任务,Fable 只解决 3 个。
  • 两者近似替代品。逐任务相关度 0.65 是本组最高,同时跑两个增加的覆盖很少。保留低成本的模型,只在 Rust 和序列化工作上升级到 Fable。

实验设置

这是 Together 在 DeepSWE 上做的 GLM-5.3 与 Claude Fable 5 对比。DeepSWE 是一个跨多种任务类型和编程语言测试模型软件工程能力的基准。两个模型几乎无法在质量上分开:Fable 5 的 pass@1 领先 0.7 个百分点,同时每次 rollout 成本是 5.4 倍,是整个 DeepSWE 榜上最贵的配置。这让有意思的问题变得很窄:准确率相同时,这笔溢价到底买到了什么?

模型pass@1平均成本每 $100 解决输出 token步数
glm-5.3 (max)69.0% ± 2.7%$3.991780k124
claude-fable-5 (max)69.7% ± 2.3%$21.633114k85

在 DeepSWE 全部 113 个任务上,两个模型各跑 4 次试验(均开最大努力档),基于公开逐试验记录共 904 次 rollout,每个模型 452 次。两者都属于纪律性强、低回归的流派,所以行为非常相似。以下所有数字都来自这一轮实测,可能与其它公开的 GLM-5.3 对 Claude Fable 5 记分卡不同。

计分板:pass@1 与 pass@k

单发是平局。Fable 5 按 DeepSWE 官方计分首发解决 69.7% 的任务,GLM-5.3 解决 69.0%,差距远在噪声带之内。一旦允许重试,两个模型就分开——且向 GLM 倾斜。两次尝试时 GLM-5.3 以 81.1% 对 77.1% 领先;四次尝试时以 87.6% 对 84.1% 领先。

pass@k 曲线:允许重试后 GLM 领先

开源模型以零头的价格匹配了 Fable 的首发准确率,并且在允许重试后持有更高的上限。不存在任何一个尝试次数,让为 Fable 支付 5.4 倍价格能买到更多覆盖。

成本对比

每次 rollout $3.99,GLM-5.3 比 $21.63 的 Fable 便宜 5.4 倍:每 $100 解决 17 个任务对 3 个。Fable 是榜上最贵的配置,而这个价格并没有给 GLM 带来速度惩罚:GLM-5.3 平均每次 rollout 35 分钟,Fable 34 分钟,基本持平。

token 画像解释了这轮运行的形态。GLM-5.3 是更不啰嗦的模型(输出 80k token 对 Fable 的 114k),尽管步数更多(124 对 85)。Fable 每步写得更多,GLM 步数更多且每步更便宜。两者都不算快,但只有一个的成本是五分之一。

准确率与成本关系

覆盖率与可靠性

把 pass@1 分解为覆盖率(至少解过一次的任务比例)和可靠性(这些任务上的通过率),两者落在平面的几乎同一个角落,GLM 略微更远。GLM-5.3 的覆盖率更高,87.6% 对 84.1%;Fable 每次尝试略稳,可靠性 82.0% 对 78.8%,并且 4/4 全过的任务更多(56 对 48)。

实践中两者都像纪律性强的通才,GLM 用一小片每次尝试的可靠性换取了明显更宽的触达范围。

失败模式

这是两模型家族相似性最明显的地方。两个模型都只在 11% 的失败中回归现有测试套件,远低于 GPT 家族的 20%,所以两者都可以在没有重回归门的情况下安全接受。

差异很小。Fable 的大失误占比更高(18% 对 GLM 的 16%),意味着它出错时更容易错得离谱。GLM 以近失误失败的比例略高(61% 对 57%)。总体上,两者以同样的纪律方式失败,这正解释了为什么它们的结果如此相关。

失败指纹对比

按任务类型谁赢

尽管 pass@1 打平,领域地图并不相同。GLM-5.3 拿下结构化、解释器风格的工作:查询与配置(88 对 72)、语言与运行时内部(83 对 78)、有状态响应式(73 对 64)、并发与持久性(62 对 45)、程序分析(64 对 56)。并发这个结果是 Fable 最弱领域里的 17 分差距。

Fable 用精确契约领域回应:数据建模与序列化(88 对 79)、构建与运维(71 对 68)、协议一致性(55 对 44)——这是 GLM 最弱的区域。GLM 赢五个领域,Fable 赢三个,Fable 在并发上的 45% 是唯一应该完全避开它的赛道。

按任务领域分解

按编程语言谁赢

Fable 的理由几乎完全建立在一门语言上:它的 Rust 是 85% 对 GLM 的 70%,15 分的差距是这次对决中最宽的单语言差距。序列化密集的工作是这个优势的天然伴随。

GLM 用榜上最好的 JavaScript 回应(90 对 75),Go 接近平手(76 对 71),TypeScript(61 对 57)。Fable 守住 Python(70 对 66)。在 Rust 和序列化密集工作之外,没有任何语言让 Fable 的 5.4 倍溢价买到有意义的准确率优势。

按语言分解

两模型有多相似

这是想同时跑两个模型的人要注意的陷阱。GLM-5.3 与 Fable 的逐任务相关度是 0.65,是本组中任何配对里最高的一致性。两者都解出 88 个任务。GLM 独得 11 个,Fable 独得 7 个,7 个战胜两者,没有任何方向上的四比零分歧。

它们的并集覆盖 113 个任务中的 106 个(93.8%),但因为它们在很大程度上的同样任务上成功和失败,配对它们比把任一者与 GPT 家族模型配对增加的多样性更少。它们是近似替代品,而当两个模型互相替代时,你保留成本更低的那个。

最冗余配对分析

级联路由:组合玩法

如果确实要两个都跑,顺序和经济性仍然偏向把开源模型放前面。先跑 GLM-5.3,只在测试套件拒绝答案时升级到 Fable:81.1% 解决率、每任务 $10.74。这比 Fable 单独(69.7%)高 11 个百分点,价格只有 Fable 自身每任务价格($21.63)的一半。

级联组合收益

考虑到 0.65 的相关度,诚实的建议更简单:对大多数工作,GLM-5.3 单独就能以五分之一的成本捕获 Fable 几乎所有的能力,Fable 只在它的 Rust 和序列化专长上值得升级。

完整数据表

指标GLM 5.3 (max)Fable 5 (max)
pass@1(官方计分)69.0%69.7%
pass@1(错误计为失败)68.8%67.3%
pass@2 / pass@481.1 / 87.6%77.1 / 84.1%
覆盖率 / 可靠性87.6 / 78.8%84.1 / 82.0%
稳(4/4)/ 墙(0/4)48 / 1456 / 18
每次 rollout 成本 / 总成本$1,806$21.63 / $9,346
每 $100 解决任务数173
平均分钟 / 步数35 / 12434 / 85
平均峰值上下文 / 输出 token155k / 80k205k / 114k
失败解剖(近失误/大失误/回归)61% / 16% / 11%57% / 18% / 11%
赢得领域数(共 8)53
赢得语言数2(JavaScript、TypeScript)3(Rust 大胜、Python、Go)
逐任务相关度 / 并集0.65 / 106 of 113(93.8%)
级联 GLM→Fable(准确率/成本)81.1% / $10.74(对比 Fable 单独 69.7% / $21.63)
单发预言机路由78.5%
基础设施错误116

113 个 DeepSWE 任务 × 每配置 4 次试验 × 均开最大努力 × 共 904 次 rollout。

方法与注意事项

  • 数据:DeepSWE v1.1 导出,113 任务 × 每配置 4 次试验,均开最大努力,来自公开逐试验记录,每方 452 次试验。
  • 计分:头条通过率使用 DeepSWE 官方计分(计入 included_in_score,排除基础设施错误)。Fable 有 16 个来自模型路由的基础设施错误,所以它的严格错误计为失败分数是 67.3 对官方的 69.7。GLM-5.3 只有 1 个。
  • pass@2、pass@4、覆盖率、并集和相关度使用逐任务通过计数。
  • 成本是公开的逐试验 cost_usd。Fable 的与轨迹 total_cost_usd 完全匹配,GLM 的是仅索引值。GLM-5.3 批次的逐轮轨迹 JSON 在分析时不在公开 CDN 上。
  • 失败解剖使用公开的逐测试分数。近失误指至少 80% 的新测试通过且基线完好。回归指基线测试被破坏。领域使用基于工件的任务分类法。
  • 级联假设验证器决定升级和给定任务的独立性。期望准确率对顺序对称,成本不对称,所以用低成本模型打头。鉴于 0.65 的相关度,组合收益有限。预言机路由是逐任务最佳单发选择,是任何单发路由器的上界。

部署建议

  1. 默认选 GLM-5.3:统计平局的首发准确率、全部重试指标领先、5.4 倍价格优势,五个领域加榜上最好的 JavaScript。
  2. 只在两个场景升级 Fable:Rust 密集(85% 对 70% 大幅领先)和序列化关键任务(88 对 79)。
  3. 不要同时跑两个当组合:0.65 相关度意味着组合收益有限;省下的预算投给 GPT 家族模型做差异化补充更值。

原文信息

  • 作者:Together AI
  • 发布时间:2026-08-21 原文地址:

文章评论(10

暮拾贝6 分钟前

刚好最近在找这方面的资料,太及时了。

回复
南山客8 分钟前

看标题就点进来了,内容果然没让人失望。

回复
林观澜51 分钟前

整理得太全面了,省了我不少时间。

回复
龙文博49 分钟前

刚好最近在找这方面的资料,太及时了。

回复
青柠微凉13 分钟前

楼主辛苦了,内容很有参考价值。

回复
陈皮话梅糖8 分钟前

看完了,收获满满,期待更多更新。

回复
三分糖去冰13 分钟前

支持作者,持续关注中。

回复
空向阳41 分钟前

整理得太全面了,省了我不少时间。

回复
一叶知秋3 分钟前

讲解得很细致,新手也能看懂。

回复
墨沐雨7 分钟前

赞同,实践出真知。

回复