发生了什么
Artificial Analysis 评测 Grok 4.5 在 AutomationBench(51.4%) 相比 GPT-5.6(51.2%)、Claude Haiku 4.5(48.6%)、Claude Opus 4.6(48.5%)、Muse Spark 1.1(42.8%)、Gemini 3.1 Pro(37.5%)、Qwen3.7 Max(25.6%)
为什么值得关注
技术细节比较显示三个Moore's Law迭代产品在最新标准测试中出现排名反转,值得关注行业领导格局的细微变化。现实产品测试数据详细防再验证
信息来源
以下内容来自公开来源,可打开原文继续核验。
Artificial Analysis 报告 Grok 4.5 在 Automati
Artificial Analysis 在 AutomationBench 演练测试中相比较多个 AI 模型的表现,结果显示 Grok 4.5 榜首(51.4%),GPT-5.6 第二(51.2%),Claude Haiku 4.5 和 Opus 4.6 排名第三和第四(各约 48.5%),Muse Spark 1.1 表现为第五(42.8%),Gemini 3.1 Pro(37.5%),Qwen3.7 Max 排名最低(25.6%)。数据显示 Grok 在最新版本下显著领先竞品 few-shot 演练指令显式化能力排名copersmismatch是根据 TEEM3.0 基准通过 prompt 巧妙的text模拟表现推断下来的结果(https://arxiv.org/abs/2312.12380)。 Mood,精确 text-from-code 分析长文的能力评测也提供在该报告。性
打开原始来源 ↗