← 返回精选动态
精选动态

Artificial Analysis发布Harvey LAB-AA法律基准测试

Artificial Analysis 发布 Harvey LAB-AA

更新于 2026年07月08日 01:48 1 条公开来源

发生了什么

Artificial Analysis 发布 Harvey LAB-AA

为什么值得关注

该基准首次量化法律领域AI的完整任务完成率,并揭示成本与表现的巨大差距,值得深入评估。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Artificial Analysis发布Harvey LAB-AA法律基准测试

twitter关注列表 2026年07月08日 01:12

Artificial Analysis重新实现Harvey的法律代理基准Harvey LAB-AA,使用由Harvey团队构建的120个.scenario测试了24个法律领域的模型。Claude Fable 5(AnthropicAI)以14.2%的全通过率遥遥领先,其次是Claude Opus 4.8和GLM-5.2(Zai_org)各7.5%。测试包括每个任务的二进制评判标准,最高模型在单个评判标准上超过90%通过率,但大多数模型在任何任务上无法完成全部要求。成本差距显著,Claude Fable 5约19美元/任务,Gemini 3.1 Flash‑Lite约0.02美元/任务。

打开原始来源 ↗
← 返回精选动态