Kimi K3 对比 GPT-5.6 Sol:904 次实测,级联路由 85.6% 胜过任一单模型
一句话结论
GPT-5.6 Sol 赢单发质量,Kimi K3 赢多次尝试和成本,而两模型成功失败的方式截然不同——先跑 Kimi K3、测试套件拒绝时升级到 Sol 的级联路由拿下 85.6%,比任一模型单独使用、甚至比完美的单发路由器都强。
904 次 rollout 的关键数字(113 个任务、每任务 4 次试验、双方均开最大努力档,逐次记录来自 deepswe.datacurve.ai 公开数据):
- 单发 Sol 领先:pass@1 72.7% 对 68.5%,差 4.2 分。
- 给更多尝试 Kimi K3 反超:pass@2 82.0 对 81.0,pass@4 89.4% 对 85.8%——全榜旗舰配置最佳。
- Kimi K3 便宜得多:每次 rollout $4.65 对 $8.37,每美元解决任务数 2.8 倍。
- Sol 更稳:4 次全中的任务 61 个对 45 个。
- 两模型分歧大(逐任务相关度 0.46),Kimi 先行升级 Sol 的级联覆盖 113 个任务中的 108 个,达约 85.6%。
总览表
| 指标 | Kimi K3 | GPT-5.6 Sol |
|---|---|---|
| DeepSWE pass@1 | 68.5% | 72.7% |
| DeepSWE pass@2 | 82.0% | 81.0% |
| DeepSWE pass@4 | 89.4% | 85.8% |
| 覆盖率(至少解出一次) | 89.4% | 85.8% |
| 可靠性(4/4 通过率) | 76.6% | 84.5% |
| 4 次全解任务数 | 45 | 61 |
| 每次 rollout 成本 | $4.65 | $8.37 |
| 每 $100 解决任务数 | 14.7 | 5.3 |
| 中位 rollout 用时 | 66 分钟 | 17 分钟 |
| 开放权重 | 是 | 否 |
计分板:pass@1 与 pass@k
单次尝试 Sol 明确获胜:官方计分 72.7% 对 68.5%。但差距收窄得很快:两次尝试时 Kimi K3 已经领先(82.0 对 81.0);四次尝试时 Kimi 的 89.4% 比 Sol 的 85.8% 高 3.6 分,是榜上所有旗舰档配置中最好的 pass@4。

成本对比
- Kimi K3 每次 rollout $4.65,GPT-5.6 Sol $8.37。
- 按解决任务计,Kimi 每 $100 交付 14.7 个解决对 Sol 的 5.3,约 2.8 倍的每美元工作量(Kimi K3 API 价格取 7 月 25 日 Moonshot 价目)。
- 代价是速度和步数:Sol 中位 rollout 17 分钟对 Kimi 的 66 分钟,Sol 步数少约 40%。端到端延迟会随推理提供方优化 Kimi K3 改善,但多步是模型行为特质。

按语言分:Go 打平(各 79);Sol 领先 Python(74-68)、TypeScript(66-60)、JavaScript(75-65);Kimi K3 拿下 Rust(65-60)。
覆盖率对可靠性:平面上的对角
把 pass@1 和 pass@4 分解成覆盖率(四次中至少解出一次)和可靠性(四次全中),两模型坐在对角。Sol 以 84.5% 可靠性、61 个四次全解任务占据”稳”的一角,覆盖 85.8%;Kimi K3 覆盖 89.4%(比任何旗舰都宽),但可靠性只有 76.6%、稳解任务 45 个。Sol 更稳更确定;Kimi K3 撒的网更宽。

两模型差异度:路由的全部本钱
Kimi K3 对 Fable 基本是回声室(相关度 0.72),Kimi K3 和 Sol 则真正分化:逐任务相关度 0.46,双向都存在”一方四中一方零中”的任务角。两模型以真正不同的方式成功和失败——这正是它们构成路由与级联强配对的原因:合计覆盖 113 个任务中的 108 个(95.6%),是榜上最佳双模型组合。
级联路由能到多高
两模型在 113 个任务中的 18 个上不一致,路由把不一致转成免费准确率。能吃下多少取决于你有没有验证器(测试套件)来截住坏答案并升级。
实际答案是约 85.6%:先跑 Kimi K3,只在测试套件拒绝结果时升级到 Sol。这比任一模型单独使用强,甚至超过完美单发路由器(83.4%)——因为级联给硬任务两次独立尝试,而不是押注一发。它还比 Sol 单干每解决更便宜:Kimi K3 在 Sol 被调用前就清掉约 70% 的队列。验证器承担重活:没有验证器,现实路由器落在 70 多分、83.4% 就是天花板。
| 路由策略 | 准确率 | 每任务成本 |
|---|---|---|
| 最佳单模型,不路由(Sol) | 72.7% | $8.37 |
| 现实学习型路由器(单发) | 72–83% | 约 $6 |
| 完美预言机路由器(单发选对) | 83.4% | 约 $6.07 |
| 级联:Kimi → 失败升级 Sol | 85.6% | $7.30 |
| 两模型各跑一次,任取其一 | 85.6% | $13.02 |
这对组合的硬上限是 95.6%:113 个任务中有 5 个在两边合计全部 8 次尝试中都没解出。过了 95.6% 你需要的是第三个模型,不是更好的路由器。

按任务类型分发
要路由得好,按编程诉求分类任务。Sol 赢 8 个领域中的 5 个:序列化(92-79)、并发(72-55)、程序分析(64-56)发给 Sol;运维工具(79-73)和运行时内部(77-75)发给 Kimi K3;一致性(61-59)是掷硬币。任务类型由 LLM 从基准提示词分类。
失败模式
两者失败方式非常不同:Kimi K3 常常接近但没通过全部测试——65% 的失败是”超过 80% 新测试已通过但有失败”的近失误,只有 11% 弄坏基线测试;Sol 则更多弄坏仓库现有测试——20% 的失败中破坏了基线测试(这与 GPT 家族其他模型一致)。
部署建议
- 有测试套件就上级联:Kimi K3 先行、失败升级 Sol,85.6% 准确率、$7.30/任务,双指标碾压 Sol 单干。
- 要单发稳定选 Sol:一次性要对、无人复核的场景,Sol 的 72.7% 和 84.5% 可靠性更合适。
- 高吞吐重试场景选 Kimi K3:pass@4 更宽、便宜 64%、开放权重可自托管,重试容忍型智能体工作量的价值之选。
原文信息
- 作者:Together AI
- 发布时间:2026-07-26 原文地址:
看标题就点进来了,内容果然没让人失望。
看标题就点进来了,内容果然没让人失望。
这个比较实用,已转发给同事。
支持作者,持续关注中。
作者写得真不错,学到了不少。
这篇文章分析得很透彻,收藏了!
这个比较实用,已转发给同事。
这个观点很中肯,深有同感。
作者写得真不错,学到了不少。
思路清晰,干货满满。