发生了什么
Artificial Analysis 发布 六项行业 AI 模型能力指数
为什么值得关注
新增跨领域模型能力量化指标,独立评测方法论公开,适合用于模型选型参考。
信息来源
以下内容来自公开来源,可打开原文继续核验。
行业 AI 模型能力指数发布
Artificial Analysis 发布六个新的行业 AI 模型能力指数,覆盖金融、法律、医疗、战略运营、工程和经济领域,基于 O*NET 任务分类并独立运行基准评估。结果显示 Claude Fable 5 在所有指数中领先,GLM-5.2 在开放权重模型中领先五个行业指数,DeepSeek V4 Flash 以极低成本完成所有行业任务。
打开原始来源 ↗六项行业能力基准发布
Artificial Analysis 发布六项新的行业能力基准,覆盖金融、法律、医疗、策略与运营、工程和经济六个领域。基准结果显示,Claude Fable 5(搭配 Opus 4.8 回落)在全部八项指数中排名第一,Claude Opus 4.8(最大版)在六项指数中位列第二,GPT-5.5(xhigh)在两项指数中位列第二。在开源模型中,GLM-5.2(最大版)在五项行业基准中领先,工程指数排名第五(得分 53),仅低于 Claude Sonnet 5(最大版,55)和 GPT-5.5(xhigh,55)两分;成本方面,DeepSeek V4 Flash 单任务费用低于 0.04 美元,而 Claude Fable 5 单任务费用达 3.48 美元,速度上 Nova 2.0 Pro Preview 中等版每任务 1.1 分钟,Claude Sonnet 5 最大版达 16.7 分钟。
打开原始来源 ↗