← 返回精选动态
精选动态

Kimi K3 max vs. GPT-5.6 Sol max 软件工程基准对比

Zain Has 分析 Kimi K3 max vs GPT-5.6 Sol max(DeepSWE 基准)

更新于 2026年07月24日 19:27 1 条公开来源

发生了什么

Zain Has 分析 Kimi K3 max vs GPT-5.6 Sol max(DeepSWE 基准)

为什么值得关注

提供了两模型在软件工程任务上的详细对比数据及路由级联策略,有助于从业者优化模型选型。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Kimi K3 max vs. GPT-5.6 Sol max 软件工程基准对比

twitter关注列表 2026年07月24日 10:24

togethercompute 团队 @zainhas 在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max。pass@1: GPT 72.7%, Kimi 68.5%;pass@2: GPT 81.0%, Kimi 82.0%;pass@4: GPT 85.8%, Kimi 89.4%。Kimi 单价约 $4.65/rollout,Sol 约 $8.37;每 $100 Kimi 解 14.7 题,Sol 约 5.3 题。推荐级联策略:先 Kimi,验证器不过再升级到 Sol,可达到 85.6% 解题率,成本约 $7.30/任务。

打开原始来源 ↗
← 返回精选动态