发生了什么
Artificial Analysis 发布 Harvey LAB-AA
为什么值得关注
该基准首次量化法律领域AI的完整任务完成率,并揭示成本与表现的巨大差距,值得深入评估。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Artificial Analysis发布Harvey LAB-AA法律基准测试
Artificial Analysis重新实现Harvey的法律代理基准Harvey LAB-AA,使用由Harvey团队构建的120个.scenario测试了24个法律领域的模型。Claude Fable 5(AnthropicAI)以14.2%的全通过率遥遥领先,其次是Claude Opus 4.8和GLM-5.2(Zai_org)各7.5%。测试包括每个任务的二进制评判标准,最高模型在单个评判标准上超过90%通过率,但大多数模型在任何任务上无法完成全部要求。成本差距显著,Claude Fable 5约19美元/任务,Gemini 3.1 Flash‑Lite约0.02美元/任务。
打开原始来源 ↗