本期判断
本期简报聚焦多项AI技术与商业进展。Moonshot AI的Kimi K3模型凭借全面性能细节及在前端代码榜的领先表现,成为关注焦点,并引发了多维度评测。Databricks完成1880亿美元估值融资,显示AI市场活跃。同时,中国国家主席习近平在世界AI大会上倡导开源与全球治理,预示政策层面将在AI领域发挥更大作用。
模型发布与评测
Kimi K3 登顶前端代码榜,公布全面细节
Moonshot AI发布Kimi K3多模态模型,2.8万亿参数MoE架构,原生百万token上下文。Frontend Code Arena以1679分登顶,超越Claude Fable 5与GPT-5.6 Sol,并在7个前端细分赛道中获6个第一。API定价输入每百万token $15。KDA混合线性注意力使百万token解码提速6.3倍,AttnRes注意力残差提升训练效率约25%。在Terminal Bench、Automation Bench、BrowseComp等智能体场景领先Fable 5,但在DeepSWE等综合指标上Fable 5更稳定。模型权重将于7月27日开源。
Artificial Analysis 发布 Kimi K3 评测
Artificial Analysis评测显示Kimi K3在AI Intelligence Index获57分,智力水平接近Opus 4.8、GPT-5.5,但落后于Fable 5、GPT-5.6 Sol。代理任务方面,Kimi K3在GDPval v2上Elo 1668,超越GLM-5.2、GPT-5.5、Opus 4.8,但低于Fable 5;在AutomationBench-AA排名第一。其成本每任务$0.94,与GPT-5.6 Sol相当,低于Opus 4.8。
InternVLA-A1.5 具身模型发布四个检查点
InternVLA-A1.5模型在ModelScope发布四个检查点,包含2.69B基础版及LIBERO、RoboTwin 2.0、DOMINO任务特定版本。该模型在六项仿真基准赛中报告最佳整体成绩,LIBERO 98.9、LIBERO-Plus 84.8、RoboTwin 2.0 93.2。训练集覆盖1.2M机器人回合、861M帧和3M多模态样本,采用可学习的潜在前瞻性令牌捕获未来动态。
Kimi K3 第三方代码生成评测表现不一
Moonshot Kimi K3模型在SWE Marathon 42.0基准测试中表现领先,但在另一第三方代码生成测试中,完成任务耗时75.6分钟(对比Grok 4.5仅5.1分钟),3个任务中仅1个成功,输出的81%为推理token。模型采用stable latentmoe激活16/896专家,量化感知训练,定价为$0.30-$15.00/mtok。
商业与人事
Databricks 完成 1880 亿美元估值融资
Databricks CEO Ali Ghodsi宣布公司以1880亿美元估值完成融资,年化收入达69亿美元(同比增长80%),其中AI产品(AI Gateway、Genie)贡献17亿美元。
政策与安全
习近平在世界AI大会倡导开源与全球治理
中国国家主席习近平在2026世界人工智能大会致辞,反对美国主导的AI技术限制,倡导开源AI与全球共治,警告以国家安全为由泛化限制将让强国垄断技术获取权。中国承诺未来五年为发展中国家提供5000个AI研究、培训与合作名额,并将与东盟、阿盟、非盟等建立合作中心。
智能体与平台
Cursor 自动化 AI 研究加速迭代
Cursor团队通过构建外循环收集用户反馈、内循环优化训练过程的系统,在约一年内使Composer 2.5成为最受欢迎模型并与SpaceXAI联合训练Grok 4.5。该系统通过大量真实交互数据、限制网络访问、维护CursorBench任务集,实现模型自我加速迭代并应对评估作弊问题。