本期判断
本期日报聚焦Kimi K3的最新评测数据和非对称竞争策略,其在前端代码和电子表格任务中表现突出。OpenAI发布首款硬件产品Codex Micro,Databricks完成30亿美元Series M融资。同时,AI代码生成已成行业趋势,长文本强化学习和生物智能记忆领域也取得研究新进展。
模型发布与更新
Kimi K3非对称竞争分析与全面评测
Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo分排名第一,超越Claude Fable 5(1631分)和GPT-5.6 Sol(1618分);但在综合智能指数中以57.1分排名第四,落后Fable 5(59.9分)和GPT-5.6 Sol(58.9分)。API定价为15美元/百万输出tokens,远低于Fable 5的50美元,并计划于7月27日开源权重,采取非对称竞争策略。
Kimi K3登顶SpreadsheetBench 2
Kimi K3在SpreadsheetBench 2基准测试中排名第一,超越Claude Fable 5,完成34.8%的workflow任务。该基准测试包含321个专家策划任务,平均每个任务涉及11.8个工作表和593.5个单元格更改,旨在评估完整的电子表格工作簿执行能力。
研究突破
蝴蝶可遗传记忆现象被发现
日本二年级学生Jo Nagai与Georgetown大学Dr. Martha Weiss合作发现,食蚜caterpillars在化蝶后仍能保持对薰衣草的回避行为,其后代也表现出遗传性回避,证明记忆可在全变态发育中保存并遗传,70%的训练过的蝴蝶及其后代表现出此特征。
Mind Lab开源2M tokens长文本RL项目
Mind Lab开源了一个支持2M tokens超长上下文的强化学习(RL)项目。该项目仅需8个GPU即可完成,大幅降低了以往需要数千个GPU的1M上下文研究的算力门槛,推动了超长上下文研究的普及和效率。
开源模型长期网络能力差距缩小
领先开源模型与闭源前沿的长期网络能力差距已从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2已匹配约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。
产品与服务
OpenAI发布首款硬件Codex Micro
OpenAI发布其首款硬件产品Codex Micro,这是一款售价230美元的桌面控制器,旨在帮助用户管理工作流程,提升AI交互和生产力。
Claude Fable 5更新Max/Team Premium限额
Anthropic宣布从7月20日起,Claude Fable 5将纳入Max和Team Premium计划,但限制为50%的使用额度。Pro和Team Standard用户将通过使用额度继续访问,并获一次性100美元信用额度。公司表示,由于需求难以预测,将分阶段推出并持续增加容量。
商业与行业动态
Databricks完成30亿美元M轮融资
数据平台Databricks正在进行一轮30亿美元的Series M融资,估值高达1880亿美元,本轮融资由Coatue领投。此前其AI产品已贡献17亿美元年收入,公司年化收入达69亿美元,同比增长80%。
AI代码生成成主流编程范式
Greg Isenberg指出,与一年前相比,现在大多数工程代码已由AI生成,标志着编程范式的根本转变。Google 75%的新代码由AI生成,Anthropic 90%以上代码由Claude编写。GitClear数据显示代码重复率上升81%,复用率下降70%。Dario Amodei预测“Coding is going away first, then software engineering”。