← 返回精选动态
精选动态

AutomationBench-AA评测

[Artificial Analysis] [公布] [AutomationBench-AA榜单](Zapier合作,测试AI agent跨40个SaaS应用的657个任务)

更新于 2026年07月07日 02:40 1 条公开来源

发生了什么

[Artificial Analysis] [公布] [AutomationBench-AA榜单](Zapier合作,测试AI agent跨40个SaaS应用的657个任务)

为什么值得关注

该基准提供了多模型在复杂工作流中的细粒度表现数据,包括防护栏违规和成本效率,值得点开原文查看完整榜单和方法论。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

AutomationBench-AA评测

twitter关注列表 2026年07月07日 02:12

Artificial Analysis与Zapier合作发布AutomationBench-AA基准测试,评估AI agent在真实SaaS工作流中的表现,涵盖Finance、HR等6个领域的657个任务,跨40个模拟应用。Claude Fable 5以48.6%得分领先,Opus 4.8为48.5%,Gemini 3.5 Flash为42.6%,GPT-5.5为42.1%。Gemini 3.5 Flash每任务成本0.49美元,GPT-5.5为1.32美元。所有模型均违反商业规则,Gemini 3.5 Flash每任务防护栏违规0.46次,比例最优。

打开原始来源 ↗
← 返回精选动态