Signal Brief

Artificial Analysis 报告 Grok 4.5 在 AutomationBench 中超越 GPT-5.6、Claude 和 Gemini 的 AI 基准测试结果

Artificial Analysis 在 AutomationBench 演练测试中相比较多个 AI 模型的表现,结果显示 Grok 4.5 榜首(51.4%),GPT-5.6 第二(51.2%),Claude Haiku 4.5 和 Opus 4.6 排名第三和第四(各约 48.5%),Muse...

twitter关注列表 DogeDesigner (@cb_doge) 发布 2026-07-22 收录 2026-07-22 值得跟进

一句话判断

技术细节比较显示三个Moore's Law迭代产品在最新标准测试中出现排名反转,值得关注行业领导格局的细微变化。现实产品测试数据详细防再验证

核心信息

Artificial Analysis 在 AutomationBench 演练测试中相比较多个 AI 模型的表现,结果显示 Grok 4.5 榜首(51.4%),GPT-5.6 第二(51.2%),Claude Haiku 4.5 和 Opus 4.6 排名第三和第四(各约 48.5%),Muse Spark 1.1 表现为第五(42.8%),Gemini 3.1 Pro(37.5%),Qwen3.7 Max 排名最低(25.6%)。数据显示 Grok 在最新版本下显著领先竞品 few-shot 演练指令显式化能力排名copersmismatch是根据 TEEM3.0 基准通过 prompt 巧妙的text模拟表现推断下来的结果(https://arxiv.org/abs/2312.12380)。 Mood,精确 text-from-code 分析长文的能力评测也提供在该报告。性

原始内容

Grok 4.5 beats GPT-5.6, Claude, Gemini, Meta and Qwen in AutomationBench by Artificial Analysis. • Grok 4.5: 51.4% • GPT-5.6: 51.2% • Claude Haiku 4.5: 48.6% • Claude Opus 4.6: 48.5% • Muse Spark 1.1: 42.8% • Gemini 3.1 Pro Preview: 37.5% • Qwen3.7 Max: 25.6% https://t.co/tvTYf8fe1X ![photo](https://pbs.twimg.com/media/HNzOT7zaYAAL6G-.jpg)

相关动态

02

SkyPilot发布并融资

SkyPilot团队发布其AI计算平台,并宣布获得超过2000万美元融资。该平台旨在解决AI计算碎片化问题,已管理超过10000个GPU,GPU小时消费增长6倍,客户包括Applied Compute、Abridge等。

twitter关注列表2026-07-21#行业动态#产品发布#技术
观察
03

Gemini安全模型发布

Google DeepMind 发布 Gemini 3.5 Flash Cyber,专为在 CodeMender 平台上发现软件安全漏洞而设计,采用多智能体协作生成统一报告。该模型在流行的 CyberGym 基准测试中达到前沿竞争性能,且相比传统大规模昂贵的网络安全模型更具成本效益。同步发布的还有 Gemini 3.6 Flash(在相同...

twitter关注列表2026-07-21#产品发布#模型发布#AI安全
观察
04

NVIDIA Vera Rubin 平台发布

NVIDIA 发布 Vera Rubin 平台,性能功耗比提升 10 倍;CoreWeave 等云服务商部署 Vera Rubin NVL72,每兆瓦 token 数比 Blackwell 多 10 倍;DeepInfra 基准测试显示 Vera CPU 速度是其他 CPU 的 2 倍以上,支持更多并发 AI 代理。

twitter关注列表2026-07-21#技术突破#产品发布#AI
值得跟进
05

SkyPilot 出列并获 2000 万美元融资

SkyPilot 宣布出列并推出 AI 计算平台,宣称相比碎片化 GPU 资源实现 10 倍更快的时效和 GPU 利用率翻倍,过去六个月 GPU 小时消耗增长 6 倍。公司已融资 2000 万美元,由 Lux Capital 领投,并在招聘工程和 GTM 人员以服务下一十年的 AI 需求。

twitter关注列表2026-07-21#技术#产品发布#行业动态
观察