发生了什么
[Artificial Analysis] [公布] [AutomationBench-AA榜单](Zapier合作,测试AI agent跨40个SaaS应用的657个任务)
为什么值得关注
该基准提供了多模型在复杂工作流中的细粒度表现数据,包括防护栏违规和成本效率,值得点开原文查看完整榜单和方法论。
信息来源
以下内容来自公开来源,可打开原文继续核验。
AutomationBench-AA评测
Artificial Analysis与Zapier合作发布AutomationBench-AA基准测试,评估AI agent在真实SaaS工作流中的表现,涵盖Finance、HR等6个领域的657个任务,跨40个模拟应用。Claude Fable 5以48.6%得分领先,Opus 4.8为48.5%,Gemini 3.5 Flash为42.6%,GPT-5.5为42.1%。Gemini 3.5 Flash每任务成本0.49美元,GPT-5.5为1.32美元。所有模型均违反商业规则,Gemini 3.5 Flash每任务防护栏违规0.46次,比例最优。
打开原始来源 ↗