发生了什么
Qwen 发布 Qwen3.7-Max(35 小时 1,158 次工具调用 10.0x)
为什么值得关注
除产品发布外,这条信息还给出了长周期自主执行、工具调用规模和内核优化提速等可验证指标,适合关注智能体能力边界与实际评测口径的读者继续看原文。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Qwen3.7-Max 发布
Qwen 正式发布 Qwen3.7-Max,并已通过 Alibaba Model Studio API 和 Qwen Studio 提供服务。该模型面向智能体场景,覆盖代码编写与调试、MCP 集成下的办公自动化、多智能体协作,以及长周期自主执行;在一项持续约 35 小时、超过 1,000 次工具调用的内核优化实验中,模型完成了 432 次内核评估,累计 1,158 次工具调用,独立写入、编译、分析并迭代优化 Extend Attention Kernel,相比 Triton reference 在多个工作负载上的几何平均提速达到 10.0x。
打开原始来源 ↗Qwen3.7-Max 发布
Alibaba 的 Qwen 发布了 Qwen3.7-Max,定位为面向智能体时代的旗舰模型,并已通过 Alibaba Model Studio API 和 Qwen Studio 提供服务。官方称它支持编程智能体、办公与生产力自动化、长周期自主执行和跨框架泛化;其中一项内核优化实验显示,该模型连续 автономously 运行 35 小时,执行了 1,000+ 次工具调用,并在单一 attention kernel 上实现 10x speedup。博客还给出多项基准结果:在 Terminal Bench 2.0、SWE-Verified、SWE-Pro、QwenWebDev、Kernel Bench L3、MMLU-Pro、LiveCodeBench 等任务上与 Opus-4.6、K2.6 Thinking、GLM-5.1 Thinking、DS-V4-Pro Max、Qwen3.6-Plus 等对比,部分指标达到或接近领先。
打开原始来源 ↗Qwen3.7-Max 发布
阿里巴巴 Qwen 团队正式发布 Qwen3.7-Max,并通过 Alibaba Model Studio 的 API 和 Qwen Studio 提供服务。该模型定位为“Agent Era”的旗舰模型,强调编程智能体、办公自动化、长周期自主执行和跨框架泛化能力;官方称其在一项内核优化任务中连续运行了 35 小时,完成 1,000+ 次工具调用且无需人工干预。博客给出了多项基准结果,对比了 Opus-4.6 Max、K2.6 Thinking、GLM-5.1 Thinking、DS-V4-Pro Max、Qwen3.6-Plus 等模型,其中包括 Terminal Bench 2.0-Terminus 69.7、SWE-Verified 80.4、MCP-Atlas 76.4、Kernel Bench L3 1.98/96%、LiveCodeBench 91.6、MMLU-Pro 89.6、MMLU-Redux 95.0、IFBench 79.1 和 MRCR-v2 128k 90.4。
打开原始来源 ↗Qwen3.7-Max 发布
Alibaba Cloud 发布 Qwen3.7-Max,称其为面向 Agent Era 的旗舰基础模型,支持 coding agent、办公/生产力助手以及跨框架使用,并可通过 Model Studio 的 API 调用。官方给出的例子包括:在 35 小时连续自主执行中完成超过 1,000 次 tool calls,针对 kernel optimization task 进行了 432 次 kernel evaluations,最终在多个 workload 上相对 Triton reference 实现 10.0x geometric mean speedup。Model Studio 页面同时标注 Qwen3.7-Max 的 API 价格为输入 $2.5/1M tokens、输出 $7.5/1M tokens,Launch time 为 2026-05-21。
打开原始来源 ↗