Kimi K3 对比 GPT-5.6 Sol:904 次实测,级联路由 85.6% 胜过任一单模型

采集助手AI 前沿2026-09-160 阅读

一句话结论

GPT-5.6 Sol 赢单发质量,Kimi K3 赢多次尝试和成本,而两模型成功失败的方式截然不同——先跑 Kimi K3、测试套件拒绝时升级到 Sol 的级联路由拿下 85.6%,比任一模型单独使用、甚至比完美的单发路由器都强。

904 次 rollout 的关键数字(113 个任务、每任务 4 次试验、双方均开最大努力档,逐次记录来自 deepswe.datacurve.ai 公开数据):

  • 单发 Sol 领先:pass@1 72.7% 对 68.5%,差 4.2 分。
  • 给更多尝试 Kimi K3 反超:pass@2 82.0 对 81.0,pass@4 89.4% 对 85.8%——全榜旗舰配置最佳。
  • Kimi K3 便宜得多:每次 rollout $4.65 对 $8.37,每美元解决任务数 2.8 倍。
  • Sol 更稳:4 次全中的任务 61 个对 45 个。
  • 两模型分歧大(逐任务相关度 0.46),Kimi 先行升级 Sol 的级联覆盖 113 个任务中的 108 个,达约 85.6%。

总览表

指标Kimi K3GPT-5.6 Sol
DeepSWE pass@168.5%72.7%
DeepSWE pass@282.0%81.0%
DeepSWE pass@489.4%85.8%
覆盖率(至少解出一次)89.4%85.8%
可靠性(4/4 通过率)76.6%84.5%
4 次全解任务数4561
每次 rollout 成本$4.65$8.37
每 $100 解决任务数14.75.3
中位 rollout 用时66 分钟17 分钟
开放权重

计分板:pass@1 与 pass@k

单次尝试 Sol 明确获胜:官方计分 72.7% 对 68.5%。但差距收窄得很快:两次尝试时 Kimi K3 已经领先(82.0 对 81.0);四次尝试时 Kimi 的 89.4% 比 Sol 的 85.8% 高 3.6 分,是榜上所有旗舰档配置中最好的 pass@4。

pass@k 曲线

成本对比

  • Kimi K3 每次 rollout $4.65,GPT-5.6 Sol $8.37。
  • 按解决任务计,Kimi 每 $100 交付 14.7 个解决对 Sol 的 5.3,约 2.8 倍的每美元工作量(Kimi K3 API 价格取 7 月 25 日 Moonshot 价目)。
  • 代价是速度和步数:Sol 中位 rollout 17 分钟对 Kimi 的 66 分钟,Sol 步数少约 40%。端到端延迟会随推理提供方优化 Kimi K3 改善,但多步是模型行为特质。

成本对比

按语言分:Go 打平(各 79);Sol 领先 Python(74-68)、TypeScript(66-60)、JavaScript(75-65);Kimi K3 拿下 Rust(65-60)。

覆盖率对可靠性:平面上的对角

把 pass@1 和 pass@4 分解成覆盖率(四次中至少解出一次)和可靠性(四次全中),两模型坐在对角。Sol 以 84.5% 可靠性、61 个四次全解任务占据”稳”的一角,覆盖 85.8%;Kimi K3 覆盖 89.4%(比任何旗舰都宽),但可靠性只有 76.6%、稳解任务 45 个。Sol 更稳更确定;Kimi K3 撒的网更宽。

覆盖率与可靠性

两模型差异度:路由的全部本钱

Kimi K3 对 Fable 基本是回声室(相关度 0.72),Kimi K3 和 Sol 则真正分化:逐任务相关度 0.46,双向都存在”一方四中一方零中”的任务角。两模型以真正不同的方式成功和失败——这正是它们构成路由与级联强配对的原因:合计覆盖 113 个任务中的 108 个(95.6%),是榜上最佳双模型组合。

级联路由能到多高

两模型在 113 个任务中的 18 个上不一致,路由把不一致转成免费准确率。能吃下多少取决于你有没有验证器(测试套件)来截住坏答案并升级。

实际答案是约 85.6%:先跑 Kimi K3,只在测试套件拒绝结果时升级到 Sol。这比任一模型单独使用强,甚至超过完美单发路由器(83.4%)——因为级联给硬任务两次独立尝试,而不是押注一发。它还比 Sol 单干每解决更便宜:Kimi K3 在 Sol 被调用前就清掉约 70% 的队列。验证器承担重活:没有验证器,现实路由器落在 70 多分、83.4% 就是天花板。

路由策略准确率每任务成本
最佳单模型,不路由(Sol)72.7%$8.37
现实学习型路由器(单发)72–83%约 $6
完美预言机路由器(单发选对)83.4%约 $6.07
级联:Kimi → 失败升级 Sol85.6%$7.30
两模型各跑一次,任取其一85.6%$13.02

这对组合的硬上限是 95.6%:113 个任务中有 5 个在两边合计全部 8 次尝试中都没解出。过了 95.6% 你需要的是第三个模型,不是更好的路由器。

级联路由收益

按任务类型分发

要路由得好,按编程诉求分类任务。Sol 赢 8 个领域中的 5 个:序列化(92-79)、并发(72-55)、程序分析(64-56)发给 Sol;运维工具(79-73)和运行时内部(77-75)发给 Kimi K3;一致性(61-59)是掷硬币。任务类型由 LLM 从基准提示词分类。

失败模式

两者失败方式非常不同:Kimi K3 常常接近但没通过全部测试——65% 的失败是”超过 80% 新测试已通过但有失败”的近失误,只有 11% 弄坏基线测试;Sol 则更多弄坏仓库现有测试——20% 的失败中破坏了基线测试(这与 GPT 家族其他模型一致)。

部署建议

  1. 有测试套件就上级联:Kimi K3 先行、失败升级 Sol,85.6% 准确率、$7.30/任务,双指标碾压 Sol 单干。
  2. 要单发稳定选 Sol:一次性要对、无人复核的场景,Sol 的 72.7% 和 84.5% 可靠性更合适。
  3. 高吞吐重试场景选 Kimi K3:pass@4 更宽、便宜 64%、开放权重可自托管,重试容忍型智能体工作量的价值之选。

原文信息

阅读原文

原文链接:https://www.jxxy.net/ai/articles/kimik3-vs-gpt56-sol-deepswe/