发生了什么
karminski-牙医 评测 GLM-5.2 Agent 能力(silicon-rider-bench)
为什么值得关注
该测试提供了细化的Agent能力对比细节(反思、顺路单、记忆地图),是其他公开评测未覆盖的维度,有助于理解智谱模型的实际Agent能力水平。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
智谱GLM-5.2 Agent能力评测领先
个人开发者karminski-牙医基于自建silicon-rider-bench测试30个模型,发现GLM-5至GLM-5.2在Agent能力上逐步进化,GLM-5.2能记忆地图并减少tool_call调用。该测试显示GLM-5的Agent能力在kimi-k2.7-code出现前领先所有国产模型,智谱因此被认为在Agent训练上领先2-4个月。
打开原始来源 ↗