一句话判断
研究实测表明一级技能布局在大型库中优于深层层级结构,且强代理在语料库足够大前无需技能索引。
核心信息
研究者发现在知识库过大时Agent skills可提升检索效率,20本书的英语开放问题准确率从0.257(原始导航)升至0.462(一级技能布局),而单本书时无增益。
原始内容
相关动态
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
论文提出 Harness Handbook 方法,通过将仓库围绕运行时行为重组并关联到源码位置,帮助编码代理找到更多需要编辑的代码点。在 Codex 和 Terminus-2 请求上,计划获胜率分别提升 10.0 和 18.9 个百分点,同时减少 token 使用 12.7% 和 8.6%。
ISO: RLVR原生优化栈
Hanqing Zhu团队提出ISO,一个RLVR-native优化栈,包含ISO-Merger(无需数据、回滚或OPD即可合并RL专家)和ISO-Optimizer(作为AdamW/Muon的即插即用包装,在Qwen3-8B-Base上匹配AdamW精度,步骤减少约2.7倍)。
Codex GPT Live 跨项目协作与屏幕读取能力
Codex GPT Live 提供跨项目协作、跨桌面文件交互、语音直对聊及屏幕内容读取能力,支持读取当前活动窗口的图像和文本进行分析。
When Do Multi-Agent Systems Help? An Information Bottleneck Perspective
该论文通过信息瓶颈视角,在5个基准测试、3种模型大小、18个测试中,比较了单agent、单agent遵循任务拆分、多agent系统的性能。发现多agent系统在信息传递紧凑完整时有效,尤其对弱模型,但当后续步骤需要精确早期细节时优势减弱或逆转。
AI代码库知识图谱方法分享
Mark Ajzenstadt 分享一个团队通过先构建知识图谱再使用AI的方法,在3.5个月内完成FedEx供应商平台重建,AI生成90%代码,合并122个PR,计算成本200美元/月。