Kimi K3 对比 GPT-5.6 Sol:904 次实测,级联路由 85.6% 胜过任一单模型

AI小蝌蚪AI 前沿2026-09-16832 阅读💛 158 收藏

一句话结论

GPT-5.6 Sol 赢单发质量,Kimi K3 赢多次尝试和成本,而两模型成功失败的方式截然不同——先跑 Kimi K3、测试套件拒绝时升级到 Sol 的级联路由拿下 85.6%,比任一模型单独使用、甚至比完美的单发路由器都强。

904 次 rollout 的关键数字(113 个任务、每任务 4 次试验、双方均开最大努力档,逐次记录来自 deepswe.datacurve.ai 公开数据):

  • 单发 Sol 领先:pass@1 72.7% 对 68.5%,差 4.2 分。
  • 给更多尝试 Kimi K3 反超:pass@2 82.0 对 81.0,pass@4 89.4% 对 85.8%——全榜旗舰配置最佳。
  • Kimi K3 便宜得多:每次 rollout $4.65 对 $8.37,每美元解决任务数 2.8 倍。
  • Sol 更稳:4 次全中的任务 61 个对 45 个。
  • 两模型分歧大(逐任务相关度 0.46),Kimi 先行升级 Sol 的级联覆盖 113 个任务中的 108 个,达约 85.6%。

总览表

指标Kimi K3GPT-5.6 Sol
DeepSWE pass@168.5%72.7%
DeepSWE pass@282.0%81.0%
DeepSWE pass@489.4%85.8%
覆盖率(至少解出一次)89.4%85.8%
可靠性(4/4 通过率)76.6%84.5%
4 次全解任务数4561
每次 rollout 成本$4.65$8.37
每 $100 解决任务数14.75.3
中位 rollout 用时66 分钟17 分钟
开放权重

计分板:pass@1 与 pass@k

单次尝试 Sol 明确获胜:官方计分 72.7% 对 68.5%。但差距收窄得很快:两次尝试时 Kimi K3 已经领先(82.0 对 81.0);四次尝试时 Kimi 的 89.4% 比 Sol 的 85.8% 高 3.6 分,是榜上所有旗舰档配置中最好的 pass@4。

pass@k 曲线

成本对比

  • Kimi K3 每次 rollout $4.65,GPT-5.6 Sol $8.37。
  • 按解决任务计,Kimi 每 $100 交付 14.7 个解决对 Sol 的 5.3,约 2.8 倍的每美元工作量(Kimi K3 API 价格取 7 月 25 日 Moonshot 价目)。
  • 代价是速度和步数:Sol 中位 rollout 17 分钟对 Kimi 的 66 分钟,Sol 步数少约 40%。端到端延迟会随推理提供方优化 Kimi K3 改善,但多步是模型行为特质。

成本对比

按语言分:Go 打平(各 79);Sol 领先 Python(74-68)、TypeScript(66-60)、JavaScript(75-65);Kimi K3 拿下 Rust(65-60)。

覆盖率对可靠性:平面上的对角

把 pass@1 和 pass@4 分解成覆盖率(四次中至少解出一次)和可靠性(四次全中),两模型坐在对角。Sol 以 84.5% 可靠性、61 个四次全解任务占据”稳”的一角,覆盖 85.8%;Kimi K3 覆盖 89.4%(比任何旗舰都宽),但可靠性只有 76.6%、稳解任务 45 个。Sol 更稳更确定;Kimi K3 撒的网更宽。

覆盖率与可靠性

两模型差异度:路由的全部本钱

Kimi K3 对 Fable 基本是回声室(相关度 0.72),Kimi K3 和 Sol 则真正分化:逐任务相关度 0.46,双向都存在”一方四中一方零中”的任务角。两模型以真正不同的方式成功和失败——这正是它们构成路由与级联强配对的原因:合计覆盖 113 个任务中的 108 个(95.6%),是榜上最佳双模型组合。

级联路由能到多高

两模型在 113 个任务中的 18 个上不一致,路由把不一致转成免费准确率。能吃下多少取决于你有没有验证器(测试套件)来截住坏答案并升级。

实际答案是约 85.6%:先跑 Kimi K3,只在测试套件拒绝结果时升级到 Sol。这比任一模型单独使用强,甚至超过完美单发路由器(83.4%)——因为级联给硬任务两次独立尝试,而不是押注一发。它还比 Sol 单干每解决更便宜:Kimi K3 在 Sol 被调用前就清掉约 70% 的队列。验证器承担重活:没有验证器,现实路由器落在 70 多分、83.4% 就是天花板。

路由策略准确率每任务成本
最佳单模型,不路由(Sol)72.7%$8.37
现实学习型路由器(单发)72–83%约 $6
完美预言机路由器(单发选对)83.4%约 $6.07
级联:Kimi → 失败升级 Sol85.6%$7.30
两模型各跑一次,任取其一85.6%$13.02

这对组合的硬上限是 95.6%:113 个任务中有 5 个在两边合计全部 8 次尝试中都没解出。过了 95.6% 你需要的是第三个模型,不是更好的路由器。

级联路由收益

按任务类型分发

要路由得好,按编程诉求分类任务。Sol 赢 8 个领域中的 5 个:序列化(92-79)、并发(72-55)、程序分析(64-56)发给 Sol;运维工具(79-73)和运行时内部(77-75)发给 Kimi K3;一致性(61-59)是掷硬币。任务类型由 LLM 从基准提示词分类。

失败模式

两者失败方式非常不同:Kimi K3 常常接近但没通过全部测试——65% 的失败是”超过 80% 新测试已通过但有失败”的近失误,只有 11% 弄坏基线测试;Sol 则更多弄坏仓库现有测试——20% 的失败中破坏了基线测试(这与 GPT 家族其他模型一致)。

部署建议

  1. 有测试套件就上级联:Kimi K3 先行、失败升级 Sol,85.6% 准确率、$7.30/任务,双指标碾压 Sol 单干。
  2. 要单发稳定选 Sol:一次性要对、无人复核的场景,Sol 的 72.7% 和 84.5% 可靠性更合适。
  3. 高吞吐重试场景选 Kimi K3:pass@4 更宽、便宜 64%、开放权重可自托管,重试容忍型智能体工作量的价值之选。

原文信息

  • 作者:Together AI
  • 发布时间:2026-07-26 原文地址:

文章评论(10

晨沐雨20 分钟前

看标题就点进来了,内容果然没让人失望。

回复
青柠微凉47 分钟前

看标题就点进来了,内容果然没让人失望。

回复
空向阳1 小时前

这个比较实用,已转发给同事。

回复
南山客6 分钟前

支持作者,持续关注中。

回复
吴超52 分钟前

作者写得真不错,学到了不少。

回复
晨沐雨25 分钟前

这篇文章分析得很透彻,收藏了!

回复
暮临风18 分钟前

这个比较实用,已转发给同事。

回复
风倚栏1 分钟前

这个观点很中肯,深有同感。

回复
风倚栏刚刚

作者写得真不错,学到了不少。

回复
雪影46 分钟前

思路清晰,干货满满。

回复