一句话判断
本文提供了 Kimi K3 在多个代理任务上的具体 Elo 评分和成本对比,显示其开源潜力但成本较高,值得跟踪其开源后的影响。
核心信息
Artificial Analysis 发布 Kimi K3 评测,模型在 AI Intelligence Index 上获得 57 分,智力水平接近 Opus 4.8 和 GPT-5.5,但落后于 Fable 5 和 GPT-5.6 Sol。Kimi K3 拥有 2.8T 参数,计划开源权重,将成为领先的开源模型。在代理任务上,Kimi K3 在 GDPval v2 上 Elo 1668,超过 GLM-5.2、GPT-5.5 和 Opus 4.8,但低于 Fable 5;在 AutomationBench-AA 上排名第一。其成本每任务 $0.94,与 GPT-5.6 Sol 相当,低于 Opus 4.8 但高于开源竞品。
原始内容
相关动态
Kimi K3 在 SpreadsheetBench 2 上排名第一
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
Mind Lab 开源长文本强化学习项目
Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。
Kimi K3非对称竞争分析
Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...
开源模型长期网络能力差距缩小至4-7个月
长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。
BestBlogs 早报 · 07-18
月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...