← 返回精选动态
精选动态

Language Models Need Sleep

CMU 和 UMD 发表 Language Models Need Sleep

更新于 2026年05月26日 23:37 1 条公开来源

发生了什么

CMU 和 UMD 发表 Language Models Need Sleep

为什么值得关注

建议重点看原文实验设置与“sleep”机制实现方式,因为它提供了一种不增加在线延迟、通过离线巩固提升多跳推理能力的思路。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Language Models Need Sleep

twitter关注列表 2026年05月26日 23:14

CMU 和 UMD 研究者在论文《Language Models Need Sleep》中提出,模型在处理深度推理任务时不只是受限于内存容量,还需要通过多次 forward pass 将当前 context 巩固成更可用的内部表示。研究使用 Rule 110 这种图灵完备的 toy task 做实验,方法是在清除 KV cache 前让模型对当前 context 进行多次 forward pass,把记忆逐步沉淀进 fast weights;预测阶段仍然只做单次 forward,因此推理延迟没有增加。实验结果显示,这种“sleep”式处理在多跳推理任务上的准确率提升了 52%。

打开原始来源 ↗
← 返回精选动态