发生了什么
CMU 和 UMD 发表 Language Models Need Sleep
为什么值得关注
建议重点看原文实验设置与“sleep”机制实现方式,因为它提供了一种不增加在线延迟、通过离线巩固提升多跳推理能力的思路。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Language Models Need Sleep
CMU 和 UMD 研究者在论文《Language Models Need Sleep》中提出,模型在处理深度推理任务时不只是受限于内存容量,还需要通过多次 forward pass 将当前 context 巩固成更可用的内部表示。研究使用 Rule 110 这种图灵完备的 toy task 做实验,方法是在清除 KV cache 前让模型对当前 context 进行多次 forward pass,把记忆逐步沉淀进 fast weights;预测阶段仍然只做单次 forward,因此推理延迟没有增加。实验结果显示,这种“sleep”式处理在多跳推理任务上的准确率提升了 52%。
打开原始来源 ↗