一句话判断
提供了两模型在软件工程任务上的详细对比数据及路由级联策略,有助于从业者优化模型选型。
核心信息
togethercompute 团队 @zainhas 在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max。pass@1: GPT 72.7%, Kimi 68.5%;pass@2: GPT 81.0%, Kimi 82.0%;pass@4: GPT 85.8%, Kimi 89.4%。Kimi 单价约 $4.65/rollout,Sol 约 $8.37;每 $100 Kimi 解 14.7 题,Sol 约 5.3 题。推荐级联策略:先 Kimi,验证器不过再升级到 Sol,可达到 85.6% 解题率,成本约 $7.30/任务。
原始内容
相关动态
Offloop多智能体超越Claude Code
Offloop 4 人团队公布其多智能体 harness 在 GDPval 基准上以 84.9 分、单任务成本 $1.65 超越 Claude Code(Opus 4.8 得 82.4 分、$14.38) 与 Codex(GPT 5.6 Sol 得 83.3 分、$5.20),并声称在 GDP.pdf(44 分) 与 JobBench(6...
ISO: RLVR原生优化栈
Hanqing Zhu团队提出ISO,一个RLVR-native优化栈,包含ISO-Merger(无需数据、回滚或OPD即可合并RL专家)和ISO-Optimizer(作为AdamW/Muon的即插即用包装,在Qwen3-8B-Base上匹配AdamW精度,步骤减少约2.7倍)。
Grok 4.5 在 VulcanBench v3 排名第一
Grok 4.5 在 VulcanBench v3 基准测试中以 91.3% 的分数排名第一。
Sakana AI 发布 Fugu-Ultra v1.1
Sakana AI 团队发布 Fugu-Ultra v1.1,通过动态编排最新前沿模型,性能比 v1.0 提升最多7.9分,在复杂编码和推理任务上超越 Fable 5(即使未在 agent pool 中使用它),且价格保持不变。
The Stack v3 发布:最大的开放代码数据集
BigCode 社区发布 The Stack v3,这是迄今最大的开放代码数据集,包含 114 TB 原始数据、15.9 TB 处理后数据、约 5T 去重 tokens,涵盖 770 种编程语言和 2.24 亿仓库,完全开放且无限制许可。相比 2024 年的 v2(68 TB raw / 550B tokens / 618 种语言),v3...