# Kimi K3 max vs. GPT-5.6 Sol max @togethercompute 团队 @zainhas 在 DeepSWE 软件工程基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max，结论很客观，并没有谁前...

- 来源：Meng Shao
- 发布时间：2026-07-24 10:24
- AIWatch 分数：64
- AIWatch 标记：当日精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01ky9svytprshr2735qaywbnhh
- 原文链接：https://x.com/shao__meng/status/2080479086481437178

## 精选理由

高信息密度，值得细读

## AI 摘要

第三方评测在 DeepSWE 基准上对比 Kimi K3 max 与 GPT-5.6 Sol max，两者各有所长：Kimi 在多次尝试（pass@2/4）、成本、Rust 和运维领域占优；Sol 在单次（pass@1）、速度、Python/TS/JS 和序列化等领域占优。任务级相关低（0.46），失败模式不同，推荐级联使用。先 Kimi 再 Sol 的级联策略可达 85.6% 解题率，成本 $7.30/任务，比单独 Sol 覆盖高 13 个百分点且成本更低，为开发者提供高效低成本方案。
核心观点：
1. pass@2/4 上 Kimi 反超 GPT，多次尝试优势明显（Kimi pass@4 89.4% vs GPT 85.8%）。
2. Kimi 成本仅为 GPT 约 55%（$4.65 vs $8.37），每 $100 解题数近 3 倍（14.7 vs 5.3）。
3. 级联策略（先 Kimi 再 Sol）实现 85.6% 解题率，成本 $7.30，比单独 Sol 覆盖高 13 个百分点。

## 正文

@togethercompute 团队 @zainhas 在 DeepSWE 软件工程基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max，结论很客观，并没有谁前面碾压谁，在真实软件工程中各有所长，搭配使用、路由 + 级联是更优的方案。

关键数据：单次稳，多次翻盘
pass@1：GPT 72.7%，Kimi 68.5%
pass@2：GPT 81.0%，Kimi 82.0%（已反超）
pass@4：GPT 85.8%，Kimi 89.4%（优势更大）

成本与速度：便宜 vs 快
· 单价：Kimi ≈ $4.65 / rollout，Sol ≈ $8.37
· 单位预算产出：每花 $100，Kimi 解约 14.7 题，Sol 约 5.3 题
· 时延：Sol 中位约 17 分钟，Kimi 约 66 分钟；Kimi 步数更多，Zain 认为是模型行为，推理侧优化后端到端延迟仍有改善空间

语言与领域专长
语言
· Kimi 更强：Rust（65–60）
· Sol 更强：Python / TS / JS
· Go：平手（79–79）

领域（8 类中 Sol 赢 5、Kimi 赢 3）
· 倾向 Sol：序列化、并发、程序分析
· 倾向 Kimi：运维工具、运行时内部
· 合规/一致性：接近抛硬币（61–59）

为何适合组合：低相关 + 不同失败模式
· 任务级相关约 0.46——成功与失败路径明显不同
· 两模型并集覆盖 108 / 113（95.6%），作者称是该基准上最好的双模型组合
· 失败形态也不同：
 · Sol：约 20% 失败会弄坏仓库原有测试（与其他 GPT 系类似）
 · Kimi：基线测试破坏较少（约 11%），但约 65% 是“差一点”——新测试过 80%+ 却未全过

实操策略：先 Kimi，再升级到 Sol
推荐级联：
1. 先跑 Kimi
2. 验证器不过，再升级到 Sol

结果：85.6% 解题率，约 $7.30 / 任务——比单独用 Sol（约 72.3%、$8.37）覆盖高约 13 个百分点，成本还更低。

也可用领域分类器直接选型；线程评论里有人问路由器实现，Zain 的核心思路是「任务分类 / 验证器驱动升级」，而非复杂三模型编排。
