发生了什么
微软 发表 NextLat(预测隐藏状态训练方法)
为什么值得关注
与传统 next token 预测相比,NextLat 通过预测隐藏状态学习紧凑世界模型,提升规划能力并加速推理,值得关注其在世界模型和长程推理方向的应用前景。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Next-Latent Prediction Transformers Learn
微软提出 NextLat 方法,在 next token 预测基础上增加隐藏状态预测任务,迫使模型学习紧凑世界模型。实验表明,该方法在迷宫导航、数学推理、图规划等任务上表现更好,并实现最高 3.3 倍推理加速,且不改变 Transformer 架构。
打开原始来源 ↗