← 返回精选动态
精选动态

GLM-5.2 反 hacking 模块分析

GLM-5.2 分析 反 hacking 模块(GLM-5.2)

更新于 2026年06月21日 00:28 1 条公开来源

发生了什么

GLM-5.2 分析 反 hacking 模块(GLM-5.2)

为什么值得关注

值得阅读原文了解该模型训练方法创新,以及反 hacking 模块如何具体提升长时任务表现

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

GLM-5.2 反 hacking 模块分析

twitter关注列表 2026年06月21日 00:09

GLM-5.2 在设计任务上达到 Opus 级别表现,同时展现出色的长时间任务能力。据官方博客介绍,该模型在训练中加入了反 hacking 模块,以解决 RL 中的 reward hacking 问题,包括模型懒惰、意图不一致、冗长、追随等问题。相比标准 goal 方法中模型常采取的捷径导致 token 浪费和效果差,这种反 hacking 能力理论上可提升长时任务结果,属前沿开放权重模型中的罕见应用。

打开原始来源 ↗
← 返回精选动态