Kimi K3 在 SpreadsheetBench 2 上排名第一
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
围绕 评测 的精选动态、来源摘要和重要性判断。
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
Artificial Analysis发布Kimi K3在编码代理指数上的评测结果:得分57,排名第5,性能与GPT-5.6 Terra和GPT-5.5持平(57),超过Opus 4.8(55),略低于Grok 4.5(58)和Fable 5(59);成本平均3.18美元/任务,比GPT-5.6 Sol便宜55%。
Physion Labs 发布 Physion-Arc 1.0 基准测试,对 Runway、Luma、MiniMax、Kling、Utopia 和 TapNow 六款 AI 视频代理进行独立人类评估,使用 30 个电影提示和 16 个指标。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。
Artificial Analysis数据显示,Grok 4.5每次任务成本仅0.31美元,而Claude Fable 5为2.75美元、Claude Opus 4.8为1.80美元、GPT-5.6 Sol为1.04美元、Kimi K3为0.95美元,Grok 4.5成本分别低约9倍、6倍、3倍和3倍;在FrontierSWE上,Grok...
Artificial Analysis 发布评测,8天内 SpaceXAI 的 Grok 4.5(54分)、OpenAI 的 GPT-5.6 Sol/Terra/Luna(最高59/55/51)、Meta 的 Muse Spark 1.1(51分)和 Moonshot AI 的 Kimi K3(57分)相继发布,前沿模型实验室从6月初的2...
GMI Cloud 对 Kimi K3 和 Claude Fable 5 进行 3D 建模对比测试:像素风格下 Kimi K3 耗时 1h11min、花费 $14.5,Fable 5 耗时 49min、花费 $21;原始风格下 Kimi K3 耗时 1h17min、花费 $19.3,Fable 5 耗时 1h5min、花费 $47.2。K...
Artificial Analysis 发布 Kimi K3 评测,模型在 AI Intelligence Index 上获得 57 分,智力水平接近 Opus 4.8 和 GPT-5.5,但落后于 Fable 5 和 GPT-5.6 Sol。Kimi K3 拥有 2.8T 参数,计划开源权重,将成为领先的开源模型。在代理任务上,Kimi...
月之暗面的 Kimi K3 在 Arena Frontend Code 排行榜以 1679 分暂列第一,超过第二名 Claude Fable 5(1631 分)和第三名 GPT-5.6 Sol(1618 分),从前代 K2.6 的第 18 名升至第一,并在七个细分类别中获六项第一。
AI/ML API 上线了 Kimi K3 模型,与 Claude Fable 5 均支持 1M-token 上下文窗口。在 vibe-coding 测试中,Kimi K3 以 1/4 的价格($3.11 对比 $12.23)在代码生成任务中表现优于 Claude Fable 5。
Atomic Chat 的本地 LLM 桌面应用给 Kimi K3、GPT‑5.6 与 Opus 4ន三种模型同样任务,要求各自生成 Road Fighter、Battle City、Q*bert 三款自玩型 HTML 版复古游戏,包含图形、敌人фа和完整 AI 玩家。输出结果显示 Kimi K3 共 18.4K tokens,成本 $...
Kimi_Moonshot 的 Kimi-K3 在前端代码 Arena 得分 1679 分,超越 Claude Fable 5,较上一版 Kimi-k2.6 提升 17 位,并将于 7 月 27 日发布完整模型权重,在 6 个 7 个评估领域中取得第一。
Google 发布 Gemini Omni Flash 多模态模型,在 Artificial Analysis 视频排行榜上文本到视频和图像到视频均位居第一,击败 ByteDance 的 Seedance 2.0。模型支持文本、图像、视频输入,生成 720p 24FPS 3-10 秒视频,定价 $0.10/秒,已通过 Gemini API...
美国团队 Thinking Machines 发布了 Inkling,这是一款采用 975B/A41B MoE 架构的多模态大模型,已开源完整参数。基准测试中 Inkling 在 IFBench(79.8% vs Claude 63.5%)和 FORTRESS Benign(95.9% vs Claude 55.1%)上超越部分闭源模型;...
ARC Prize 公布了 ARC-AGI-3 Milestone #1 的三位获奖者,分别是 tufalabs (1.21%, $25K)、Reki (0.867%, $7.5K) 和 Md Boktiar Mahbub Murad (0.864%, $5K),三位获奖者都开源了他们的解决方案。
Artificial Analysis重新实现Harvey的法律代理基准Harvey LAB-AA,使用由Harvey团队构建的120个.scenario测试了24个法律领域的模型。Claude Fable 5(AnthropicAI)以14.2%的全通过率遥遥领先,其次是Claude Opus 4.8和GLM-5.2(Zai_org)各...
Artificial Analysis 发布六个新的行业 AI 模型能力指数,覆盖金融、法律、医疗、战略运营、工程和经济领域,基于 O*NET 任务分类并独立运行基准评估。结果显示 Claude Fable 5 在所有指数中领先,GLM-5.2 在开放权重模型中领先五个行业指数,DeepSeek V4 Flash 以极低成本完成所有行业任...
Matrix 在 GDPval-Bench 上取得 95.45% 的成绩,超过 Codex 的 84.9% 和 Claude Code 的 80.3%,推文认为其更像一个真正的 AI 公司操作系统层而非提示编排器。
RPC-Bench是一个长上下文和多模态文档理解基准,包含61.3K QA对(来自4150篇论文),其中约15K经过人工验证;GPT-5在该基准上的正确性-完整性得分为68.2%,调整简洁性后降至37.46%。
研究机构评估实验模型GLM-5.2的性能,在部分基准测试中接近GPT-5.2领域,但仍比Mythos类模型偏弱,显示开源模型持续占据竞争性地位。
关键信息提供