一句话判断
值得关注 Kimi K3 在代码能力上的突破,建议阅读原文了解细分类别表现。
核心信息
月之暗面的 Kimi K3 在 Arena Frontend Code 排行榜以 1679 分暂列第一,超过第二名 Claude Fable 5(1631 分)和第三名 GPT-5.6 Sol(1618 分),从前代 K2.6 的第 18 名升至第一,并在七个细分类别中获六项第一。
原始内容
相关动态
Databricks 融资 30 亿美元估值 1880 亿
数据平台 Databricks 正在进行一轮 30 亿美元的 Series M 融资,估值达 1880 亿美元,由 Coatue 领投。
Kimi K3 在 SpreadsheetBench 2 上排名第一
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
Mind Lab 开源长文本强化学习项目
Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。
Kimi K3非对称竞争分析
Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...
AI 代码生成大势所趋
Greg Isenberg 发文指出,相比一年前的手写代码实践,如今大多数工程代码已由 AI 生成,标志着编程范式的根本转变。他援引了 Google 75% 新代码由 AI 生成、Anthropic 90%+ 代码由 Claude 编写、GitClear 代码重复率上升 81% 复用率下降 70% 等具体数据,并引用 Dario Amod...