Signal Feed

#评测 主题信号

围绕 评测 的精选动态、来源摘要和重要性判断。

动态列表

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Kimi K3 编码代理评测

Artificial Analysis发布Kimi K3在编码代理指数上的评测结果:得分57,排名第5,性能与GPT-5.6 Terra和GPT-5.5持平(57),超过Opus 4.8(55),略低于Grok 4.5(58)和Fable 5(59);成本平均3.18美元/任务,比GPT-5.6 Sol便宜55%。

twitter关注列表2026-07-17#AI模型#评测
观察
03

Runway Agent 在第三方评测中全面领先

Physion Labs 发布 Physion-Arc 1.0 基准测试,对 Runway、Luma、MiniMax、Kling、Utopia 和 TapNow 六款 AI 视频代理进行独立人类评估,使用 30 个电影提示和 16 个指标。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。

twitter关注列表2026-07-17#评测#多模态#模型
观察
04

Grok 4.5成本效率对比评测

Artificial Analysis数据显示,Grok 4.5每次任务成本仅0.31美元,而Claude Fable 5为2.75美元、Claude Opus 4.8为1.80美元、GPT-5.6 Sol为1.04美元、Kimi K3为0.95美元,Grok 4.5成本分别低约9倍、6倍、3倍和3倍;在FrontierSWE上,Grok...

twitter关注列表2026-07-17#AI#模型#评测
观察
05

8天内四款前沿模型发布评测

Artificial Analysis 发布评测,8天内 SpaceXAI 的 Grok 4.5(54分)、OpenAI 的 GPT-5.6 Sol/Terra/Luna(最高59/55/51)、Meta 的 Muse Spark 1.1(51分)和 Moonshot AI 的 Kimi K3(57分)相继发布,前沿模型实验室从6月初的2...

twitter关注列表2026-07-17#模型发布#评测#技术突破
值得跟进
06

GMI Cloud 测试 Kimi K3 vs Claude Fable 5 3D 建模

GMI Cloud 对 Kimi K3 和 Claude Fable 5 进行 3D 建模对比测试:像素风格下 Kimi K3 耗时 1h11min、花费 $14.5,Fable 5 耗时 49min、花费 $21;原始风格下 Kimi K3 耗时 1h17min、花费 $19.3,Fable 5 耗时 1h5min、花费 $47.2。K...

twitter关注列表2026-07-16#模型#评测#技术
观察
07

Artificial Analysis 评测 Kimi K3

Artificial Analysis 发布 Kimi K3 评测,模型在 AI Intelligence Index 上获得 57 分,智力水平接近 Opus 4.8 和 GPT-5.5,但落后于 Fable 5 和 GPT-5.6 Sol。Kimi K3 拥有 2.8T 参数,计划开源权重,将成为领先的开源模型。在代理任务上,Kimi...

twitter关注列表2026-07-16#模型#评测#开源
观察
08

Kimi K3 在 Arena 代码排行榜登顶

月之暗面的 Kimi K3 在 Arena Frontend Code 排行榜以 1679 分暂列第一,超过第二名 Claude Fable 5(1631 分)和第三名 GPT-5.6 Sol(1618 分),从前代 K2.6 的第 18 名升至第一,并在七个细分类别中获六项第一。

twitter关注列表2026-07-17#模型#评测#行业动态
观察
11

Kimi-K3 登顶前端测试

Kimi_Moonshot 的 Kimi-K3 在前端代码 Arena 得分 1679 分,超越 Claude Fable 5,较上一版 Kimi-k2.6 提升 17 位,并将于 7 月 27 日发布完整模型权重,在 6 个 7 个评估领域中取得第一。

twitter关注列表2026-07-16#技术突破#评测#行业动态
观察
13

美国团队发布 Inkling 大模型

美国团队 Thinking Machines 发布了 Inkling,这是一款采用 975B/A41B MoE 架构的多模态大模型,已开源完整参数。基准测试中 Inkling 在 IFBench(79.8% vs Claude 63.5%)和 FORTRESS Benign(95.9% vs Claude 55.1%)上超越部分闭源模型;...

twitter关注列表2026-07-16#大模型#开源#评测
观察
14

ARC-AGI-3 Milestone #1 获奖公布

ARC Prize 公布了 ARC-AGI-3 Milestone #1 的三位获奖者,分别是 tufalabs (1.21%, $25K)、Reki (0.867%, $7.5K) 和 Md Boktiar Mahbub Murad (0.864%, $5K),三位获奖者都开源了他们的解决方案。

twitter关注列表2026-07-07#评测#研究#AI产业
观察
16

行业 AI 模型能力指数发布

Artificial Analysis 发布六个新的行业 AI 模型能力指数,覆盖金融、法律、医疗、战略运营、工程和经济领域,基于 O*NET 任务分类并独立运行基准评估。结果显示 Claude Fable 5 在所有指数中领先,GLM-5.2 在开放权重模型中领先五个行业指数,DeepSeek V4 Flash 以极低成本完成所有行业任...

twitter关注列表2026-07-07#分析#评测#大模型
观察
18

RPC-Bench 论文理解基准

RPC-Bench是一个长上下文和多模态文档理解基准,包含61.3K QA对(来自4150篇论文),其中约15K经过人工验证;GPT-5在该基准上的正确性-完整性得分为68.2%,调整简洁性后降至37.46%。

twitter关注列表2026-06-29#技术#评测#数据
观察