← 返回精选动态
精选动态

Qwen3.7 Max

Artificial Analysis 评测 Qwen3.7 Max(56.6, 1M tokens)

更新于 2026年05月21日 21:57 2 条公开来源

发生了什么

Artificial Analysis 评测 Qwen3.7 Max(56.6, 1M tokens)

为什么值得关注

建议点开原文看完整 benchmark 拆分和与 frontier 模型的对比,因为这次提升并非单纯来自知识准确率,而是与 abstention、幻觉率和推理型评测分项变化相关。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Qwen3.7 Max

twitter关注列表 2026年05月21日 16:14

Artificial Analysis 评测 Alibaba 的新旗舰闭源模型 Qwen3.7 Max,称其在 Artificial Analysis Intelligence Index 上得分 56.6,较 4 月发布的 Qwen3.6 Max Preview 的 51.8 提升 4.8 分,但仍落后于 OpenAI、Anthropic 和 Google 的模型。该版本上下文窗口从 256K 提升到 1M tokens,仅支持文本输入输出;定价尚未公布,而 Qwen3.6 Max Preview 的 first-party API 价格为每 100 万输入 tokens $1.30、输出 tokens $7.80。对 reasoning 版本的细分显示,提升主要来自科学推理、agentic 能力和 coding,其中 CritPt 提升 9.7 个百分点、HLE 提升 9.2 个百分点、TerminalBench Hard 提升 6.9 个百分点、GDPval-AA 提升 42 Elo;同时 AA-Omniscience 的 accuracy 从 37.7% 降到 30.1%,hallucination rate 从 44.2% 降到 22.9%,模型用 96.7M output tokens 完成评测,较前代的 73.9M 增加约 31%。

打开原始来源 ↗
02

Qwen3.7-Max 登顶 56.6

twitter关注列表 2026年05月21日 21:52

Artificial Analysis 公布,Alibaba 的 Qwen3.7 Max 在 Artificial Analysis Intelligence Index 上得分 56.6,较 Qwen3.6 Max Preview 的 51.8 提升 4.8 分。该提升主要来自科学推理、agentic 能力和编程:CritPt 从 3.7% 升至 13.4%,HLE 从 28.9% 升至 38.1%,TerminalBench Hard 从 43.9% 升至 50.8%,GDPval-AA 从 1504 升至 1546。报告同时指出,Qwen3.7 Max 在 AA-Omniscience 上准确率从 37.7% 降至 30.1%,但幻觉率从 44.2% 降至 22.9%,且其评测使用了 96.7M 输出 tokens,较 Qwen3.6 Max Preview 的 73.9M 增加约 31%;上下文窗口从 256K 扩展到 1M tokens,价格尚未公布,仍为 proprietary closed weights。

打开原始来源 ↗
← 返回精选动态