发生了什么
Alibaba 发布 Qwen3.7-Max(56.6 分)
为什么值得关注
新增了面向 agent 的可靠性设计、56.6 分的基准成绩,以及推理内核 10.0 倍几何平均加速,适合关注生产级 agent 和推理效率优化的人直接看原帖与博客。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Alibaba 发布 Qwen3.7-Max
Alibaba 发布了旗舰模型 Qwen3.7-Max,强调其面向真实任务和生产环境,重点提升 agent 可靠性,支持规划步骤、调用工具、检查结果、修正错误并持续执行。该模型在 Artificial Analysis Intelligence Index 上获得 56.6 分,较 Qwen3.6-Max 提升 4.8 分,排名第 5,基本与 GPT 5.4 (xhigh) 持平。官方还称,Qwen3.6 Max Preview 相比的提升主要集中在科学推理、agent 能力和编程;推理内核经过多轮 GPU 低层优化后,几何平均速度从接近基线提升到 10.0 倍。官方同时表示,该模型可通过 Alibaba Model Studio API 和 Qwen Studio 体验,并支持 Claude Code、OpenClaw、Qwen Code 等不同栈。
打开原始来源 ↗Qwen3.7-Max 登场
Artificial Analysis 公布,Alibaba 的 Qwen3.7 Max 在 Artificial Analysis Intelligence Index 上得分 56.6,较 Qwen3.6 Max Preview 的 51.8 提升 4.8 分。该提升主要集中在 scientific reasoning、agentic capability 和 coding:CritPt 从 3.7% 升至 13.4%,HLE 从 28.9% 升至 38.1%,TerminalBench Hard 从 43.9% 升至 50.8%,GDPval-AA 从 1504 提升到 1546 Elo;同时 AA-Omniscience 的 accuracy 从 37.7% 降至 30.1%,hallucination rate 从 44.2% 降至 22.9%。Qwen3.7 Max 使用 96.7M output tokens 跑完该指数,较 Qwen3.6 Max Preview 的 73.9M 增加约 31%;它的 context window 为 1M tokens,较上一代的 256K 提升,模型仍为 proprietary、closed weights,价格尚未公布。
打开原始来源 ↗Alibaba发布Qwen 3.7 Max
Alibaba发布了Qwen 3.7 Max,这是其最新的专有模型,面向 agentic coding、complex reasoning 和 long-horizon execution。Artificial Analysis 披露,该模型在 Artificial Analysis Intelligence Index 上得分 56.6,较 Qwen3.6 Max Preview 的 51.8 提升 4.8 分;同时该分数超过了近期发布的 Gemini 3.5 Flash 和 Kimi K2.6,但 Alibaba 仍落后于 OpenAI、Anthropic 和 Google 的模型。
打开原始来源 ↗