一句话判断
与常见的摘要式记忆不同,该方法证明了无损存储与可编程检索的有效性,建议阅读原文了解具体实现细节。
核心信息
PRO-LONG方法通过保留所有过去动作的搜索日志,使编码代理在长期任务中更可靠。在ARC-AGI-3的25个隐藏规则游戏中,该方法将基础代理性能平均提升18个百分点,同时使用4.2到5.8倍更少的计费令牌。
原始内容
相关动态
Offloop多智能体超越Claude Code
Offloop 4 人团队公布其多智能体 harness 在 GDPval 基准上以 84.9 分、单任务成本 $1.65 超越 Claude Code(Opus 4.8 得 82.4 分、$14.38) 与 Codex(GPT 5.6 Sol 得 83.3 分、$5.20),并声称在 GDP.pdf(44 分) 与 JobBench(6...
SANA-Video 2.0 发布
Enze Xie 团队发布 SANA-Video 2.0,采用混合线性-softmax 注意力、块注意力残差和 Sol-Engine 加速,统一 5B 和 14B 模型,在 16 节点 H100 上训练 5B 模型,VBench 总分 84.30,单 H100 生成 720p/5s 仅需 13.06s,速度比 Wan 2.2-A14B 快...
Ant Ling 发布 Ling-3.0-flash 模型
Ant Ling 发布 Ling-3.0-flash 混合推理 MoE 模型,124B 参数,仅 5.1B 活跃参数,采用 KDA+MLA 混合注意力机制,支持 256K 上下文。以 1/8 总参数量和 1/12 活跃参数量,在多数基准上匹配或超越其 1T 旗舰模型。SGLang 正与其团队合作提供 day-0 支持。
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
论文提出 Harness Handbook 方法,通过将仓库围绕运行时行为重组并关联到源码位置,帮助编码代理找到更多需要编辑的代码点。在 Codex 和 Terminus-2 请求上,计划获胜率分别提升 10.0 和 18.9 个百分点,同时减少 token 使用 12.7% 和 8.6%。
Is Progressive Disclosure All You Need for Long-Context Agents?
研究者发现在知识库过大时Agent skills可提升检索效率,20本书的英语开放问题准确率从0.257(原始导航)升至0.462(一级技能布局),而单本书时无增益。