Signal Brief

Kimi K3 max vs. GPT-5.6 Sol max 软件工程基准对比

togethercompute 团队 @zainhas 在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max。pass@1: GPT 72.7%, Kimi 68.5%;pass@2: GPT 81.0%, Kimi 82.0%;pass@4: GPT 85....

twitter关注列表 meng shao (@shao__meng) 发布 2026-07-24 收录 2026-07-24 观察

一句话判断

提供了两模型在软件工程任务上的详细对比数据及路由级联策略,有助于从业者优化模型选型。

核心信息

togethercompute 团队 @zainhas 在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max。pass@1: GPT 72.7%, Kimi 68.5%;pass@2: GPT 81.0%, Kimi 82.0%;pass@4: GPT 85.8%, Kimi 89.4%。Kimi 单价约 $4.65/rollout,Sol 约 $8.37;每 $100 Kimi 解 14.7 题,Sol 约 5.3 题。推荐级联策略:先 Kimi,验证器不过再升级到 Sol,可达到 85.6% 解题率,成本约 $7.30/任务。

原始内容

Kimi K3 max vs. GPT-5.6 Sol max @togethercompute 团队 @zainhas 在 DeepSWE 软件工程基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max,结论很客观,并没有谁前面碾压谁,在真实软件工程中各有所长,搭配使用、路由 + 级联是更优的方案。 关键数据:单次稳,多次翻盘 pass@1:GPT 72.7%,Kimi 68.5% pass@2:GPT 81.0%,Kimi 82.0%(已反超) pass@4:GPT 85.8%,Kimi 89.4%(优势更大) 成本与速度:便宜 vs 快 · 单价:Kimi ≈ $4.65 / rollout,Sol ≈ $8.37 · 单位预算产出:每花 $100,Kimi 解约 14.7 题,Sol 约 5.3 题 · 时延:Sol 中位约 17 分钟,Kimi 约 66 分钟;Kimi 步数更多,Zain 认为是模型行为,推理侧优化后端到端延迟仍有改善空间 语言与领域专长 语言 · Kimi 更强:Rust(65–60) · Sol 更强:Python / TS / JS · Go:平手(79–79) 领域(8 类中 Sol 赢 5、Kimi 赢 3) · 倾向 Sol:序列化、并发、程序分析 · 倾向 Kimi:运维工具、运行时内部 · 合规/一致性:接近抛硬币(61–59) 为何适合组合:低相关 + 不同失败模式 · 任务级相关约 0.46——成功与失败路径明显不同 · 两模型并集覆盖 108 / 113(95.6%),作者称是该基准上最好的双模型组合 · 失败形态也不同: · Sol:约 20% 失败会弄坏仓库原有测试(与其他 GPT 系类似) · Kimi:基线测试破坏较少(约 11%),但约 65% 是“差一点”——新测试过 80%+ 却未全过 实操策略:先 Kimi,再升级到 Sol 推荐级联: 1. 先跑 Kimi 2. 验证器不过,再升级到 Sol 结果:85.6% 解题率,约 $7.30 / 任务——比单独用 Sol(约 72.3%、$8.37)覆盖高约 13 个百分点,成本还更低。 也可用领域分类器直接选型;线程评论里有人问路由器实现,Zain 的核心思路是「任务分类 / 验证器驱动升级」,而非复杂三模型编排。 ![photo](https://pbs.twimg.com/media/HN9YsdkaMAAWvHp.jpg) > **引用原帖 Zain (@zainhas):** > Deepdive: Kimi K3 max vs. GPT 5.6 Sol max on software engineering/DeepSWE tasks. > Both of these models provide nice specializations and routing/cascading between them is the right way to go! > full deep-dive 👇(1/n)🧵 https://t.co/lAof2PqV1h > https://x.com/zainhas/status/2080054742584353216

相关动态

01

Offloop多智能体超越Claude Code

Offloop 4 人团队公布其多智能体 harness 在 GDPval 基准上以 84.9 分、单任务成本 $1.65 超越 Claude Code(Opus 4.8 得 82.4 分、$14.38) 与 Codex(GPT 5.6 Sol 得 83.3 分、$5.20),并声称在 GDP.pdf(44 分) 与 JobBench(6...

twitter关注列表2026-07-23#评测#技术突破#行业动态
观察
02

ISO: RLVR原生优化栈

Hanqing Zhu团队提出ISO,一个RLVR-native优化栈,包含ISO-Merger(无需数据、回滚或OPD即可合并RL专家)和ISO-Optimizer(作为AdamW/Muon的即插即用包装,在Qwen3-8B-Base上匹配AdamW精度,步骤减少约2.7倍)。

twitter关注列表2026-07-24#技术#研究#技术报告
观察
04

Sakana AI 发布 Fugu-Ultra v1.1

Sakana AI 团队发布 Fugu-Ultra v1.1,通过动态编排最新前沿模型,性能比 v1.0 提升最多7.9分,在复杂编码和推理任务上超越 Fable 5(即使未在 agent pool 中使用它),且价格保持不变。

twitter关注列表2026-07-24#产品发布#模型
观察
05

The Stack v3 发布:最大的开放代码数据集

BigCode 社区发布 The Stack v3,这是迄今最大的开放代码数据集,包含 114 TB 原始数据、15.9 TB 处理后数据、约 5T 去重 tokens,涵盖 770 种编程语言和 2.24 亿仓库,完全开放且无限制许可。相比 2024 年的 v2(68 TB raw / 550B tokens / 618 种语言),v3...

twitter关注列表2026-07-23#技术#开源#模型
观察