DeepSeek V4 Pro 对比 Claude Fable 5:90 倍价差与 0.39 相关度,最便宜的路线是两个都用
一句话结论
Fable 赢下首发,Pro 赢下之后每一次尝试,而最便宜的路线是把两个都用上。
先跑 DeepSeek V4 Pro 0813,只在失败时升级到 Claude Fable 5。这个级联解决 82.7% 的 DeepSWE 任务、每个 $8.28。Fable 单独解决 69.7%、每个 $21.63——高 13 个百分点的同时便宜 62%。
- Fable 赢第一次尝试。pass@1 69.7% 对 62.8%,领先 7 分。
- Pro 赢之后每次尝试。pass@2 打平(78.5% 对 77.1%),pass@4 领先(88.5% 对 84.1%)。
- 价格差距 90 倍。每次 rollout $0.24 对 $21.63。每 $100 花费,Pro 解决 260 个任务,Fable 解决 3 个。
- 它们在不同的任务上失败。0.39 的逐任务相关度是实测过的最分化配对,两者合计覆盖 113 个任务中的 107 个。这种分歧正是路由成立全部理由。
实验设置
这是 Together 在 DeepSWE 上做的 DeepSeek V4 Pro 0813 与 Claude Fable 5 对比,两模型坐在价格表的两个极端:Claude Fable 5 是整个 DeepSWE 榜上最贵的 rollout,DeepSeek V4 Pro 0813 是最便宜之一。Fable 首发准 7 分而每次 rollout 贵九十倍,所以真正的问题不是哪个模型更好,而是 90 倍溢价到底买到了什么、什么时候值得付。

| 模型 | pass@1 | 平均成本 | 每 $100 解决 | 输出 token | 步数 |
|---|---|---|---|---|---|
| claude-fable-5 (max) | 69.7% ± 2.3% | $21.63 | 3 | 115k | 79 |
| deepseek-v4-pro-0813 (max) | 62.8% ± 3.1% | $0.24 | 260 | 101k | 146 |
在全部 113 个 DeepSWE 任务上各跑 4 次试验(均开最大努力档),共 904 次 rollout(每方 452 次)。Fable 是昂贵的匠人,Pro 是价值异类,两者的分歧比本组任何配对都大——这正是它们最有意思的地方。
计分板:pass@1 与 pass@k
单发 Fable 领先:官方计分 pass@1 69.7% 对 Pro 的 62.8%。但这个领先很脆弱。两次尝试时 Pro 追平(78.5 对 77.1),四次时 Pro 的 88.5% pass@4 超过 Fable 的 84.1% 超过 4 分。对一个贵九十倍的模型,Fable 既不掌握上限,也无法在重试下守住首发优势。低成本模型同时拥有更宽的触达和更高的 best-of-k。

成本对比
每次 rollout $0.24,DeepSeek V4 Pro 0813 比 Fable($21.63)便宜 90 倍:每 $100 解决 260 个任务对 3 个。这是实测过配对中最宽的成本差距,Fable 是榜上最贵配置。不同寻常的是,低价没有带来你预期的速度惩罚:Fable 中位 rollout 31 分钟对 Pro 的 35 分钟,基本持平——因为 Fable 是榜上最啰嗦的模型(115k 输出 token)尽管步数更少(79 对 146)。Pro 步数多,Fable 每步写得多。两个模型都不算快。

失败模式
两者在不动坏东西上都很纪律:DeepSeek V4 Pro 0813 和 Fable 各只在 11% 的失败中回归现有测试套件,远低于 GPT 家族的 20%。差异在另一个方向:Fable 的大失误份额最大(18% 对 Pro 的 10%),意味着 Fable 出错时更容易错得离谱——是偏离靶心很远的解,而不是差一个边界条件。Pro 更常以接近正确失败(66% 近失误对 Fable 的 57%)。所以两者都能不带重回归门安全接受,但 Fable 的失误是更贵的调试种类。

按任务类型
Fable 的匠气体现在推理密集、精确契约的领域:赢 8 个中的 6 个,以数据建模与序列化 88%(超 Pro 24 分)和语言内部(78)领衔。但 DeepSeek V4 Pro 0813 拿下两个,而且都重要:有状态响应式(66 对 64)以及并发与持久性(58 对 45)——在恰好的 Fable 最差领域里 13 分的优势。Fable 并发上的 45% 是它最弱的格子,也是唯一一个低成本模型不只是更便宜、而是更好工程师的领域。

按编程语言
Fable 赢五门语言中的四门,但支撑其价格的是 Rust:85% 对 Pro 的 65%,20 分差距是这次对决中最宽的单语言差距。Fable 显然是序列化和 Rust 专家。其它地方差距比价格暗示的更接近(Python 70 对 60、Go 71 对 67、JavaScript 75 对 65),而 DeepSeek V4 Pro 0813 实际拿下 TypeScript(61 对 57)。在 Rust 和序列化之外,为 90 倍付费的理由很难成立。

两模型差异度:真正的互补
这里是救赎的特征。逐任务相关度只有 0.39,是所有 DeepSeek-Pro 配对中最低的,这两个模型真正意见不合。两者都解出 88 个任务;Pro 独得 12 个,Fable 独得 7 个,只有 6 个战胜两者。并集覆盖 113 中的 107(94.7%),且分歧双向存在:DeepSeek V4 Pro 0813 在 awilix-async-container-initialization 上四比零横扫而 Fable 从未解出,Fable 则四比零横扫 4 个 Pro 全零的任务(包括 koota-query-predicates 和 testem-bail-on-test-failure)。这是真正的互补性,不是冗余。

级联路由:组合玩法
多样性加价格让级联很有说服力。先跑 DeepSeek V4 Pro 0813,只在测试套件拒绝答案时升级到 Fable:82.7% 解决率、每任务 $8.28。比 Fable 单独(69.7%)高 13 个百分点,价格远低于 Fable 自身每任务价格($21.63)的一半。低成本首段清空大部分队列,Fable 的溢价只花在硬核残余上,这些任务还获得第二次独立尝试。级联也击败完美的单发预言机路由(78.8%)。顺序不可选:Pro 先行 $8.28,Fable 先行 $21.71,准确率相同。

完整数据表
| 指标 | deepseek-v4-pro-0813 (max) | claude-fable-5 (max) |
|---|---|---|
| pass@1(官方计分) | 62.8% | 69.7% |
| pass@1(错误计为失败) | 62.8% | 67.3% |
| pass@2 / pass@4 | 78.5 / 88.5% | 77.1 / 84.1% |
| 覆盖率 / 可靠性 | 88.5 / 71.0% | 84.1 / 82.0% |
| 稳(4/4)/ 墙(0/4) | 35 / 13 | 56 / 18 |
| 每次 rollout 成本 / 总成本 | $109 | $21.63 / $9,346 |
| 每 $100 解决任务数 | 261 | 3 |
| 中位分钟 / 步数 | 35 / 146 | 31 / 79 |
| 中位峰值上下文 / 输出 token | 232k / 101k | 202k / 115k |
| 失败解剖(近失误/大失误/回归) | 66% / 10% / 11% | 57% / 18% / 11% |
| 赢得领域数(共 8) | 2(有状态、并发) | 6 |
| 赢得语言数 | 1(TypeScript) | 4(Rust 大胜) |
| 逐任务相关度 / 并集 | 0.39 / 107 of 113(94.7%) | |
| 级联 Pro→Fable(准确率/成本) | 82.7% / $8.28(对比 Fable 单独 69.7% / $21.63) | |
| 单发预言机路由 | 78.8% | |
| 基础设施错误 | 0 | 16 |
部署建议
- 不要把 Fable 当默认:它是榜上最难自洽的模型——最贵、首发优势被重试抹掉、四发上限也不占优。
- 只为两件事买 Fable:Rust(85%)和序列化密集工作(88%),这两个场景它的质量真正对得起价格。
- Pro 是另一极端画像:首发接近 Fable、上限更高、失败画像同等或更好、便宜 90 倍——只是让出 Rust 和精确契约领域。最好的用法是把 Fable 当作低成本 Pro 首段后面的选择性升级,只对真正需要 Rust 或序列化专家的少量任务付费。
原文信息
- 作者:Together AI
- 发布时间:2026-08-17 原文地址:
思路清晰,干货满满。
作者写得真不错,学到了不少。