← 返回精选动态
精选动态

Erica 发布 TERMS-Bench

TERMS-Bench 发布用于评测 LLM 谈判智能体,并公布 Claude Opus 4.6、GLM 5.1 和 Gemma 4 31B 等模型表现。

更新于 2026年05月17日 21:19 1 条公开来源

发生了什么

TERMS-Bench 发布用于评测 LLM 谈判智能体,并公布 Claude Opus 4.6、GLM 5.1 和 Gemma 4 31B 等模型表现。

为什么值得关注

该基准聚焦智能体在经济谈判中的可验证行为能力,对评估模型的对手建模、协议鲁棒性和商业场景应用潜力有参考价值。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Erica 发布 TERMS-Bench

twitter关注列表 2026年05月17日 12:30

Erica 发布 TERMS-Bench,这是一个面向真实经济谈判场景的三层 LLM 智能体基准,采用环境本身作为验证器,而不是 LLM-as-judge 或结果打分规则。基准结果显示 Claude Opus 4.6 在前沿模型中排名第一,Z.ai 的 GLM 5.1 第二,Gemma 4 31B 是表现最好的开源权重模型。

打开原始来源 ↗
← 返回精选动态