发生了什么
TERMS-Bench 发布用于评测 LLM 谈判智能体,并公布 Claude Opus 4.6、GLM 5.1 和 Gemma 4 31B 等模型表现。
为什么值得关注
该基准聚焦智能体在经济谈判中的可验证行为能力,对评估模型的对手建模、协议鲁棒性和商业场景应用潜力有参考价值。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Erica 发布 TERMS-Bench
Erica 发布 TERMS-Bench,这是一个面向真实经济谈判场景的三层 LLM 智能体基准,采用环境本身作为验证器,而不是 LLM-as-judge 或结果打分规则。基准结果显示 Claude Opus 4.6 在前沿模型中排名第一,Z.ai 的 GLM 5.1 第二,Gemma 4 31B 是表现最好的开源权重模型。
打开原始来源 ↗