一句话判断
系统梳理了 Harness Engineering 在递归自改进中的具体技术路径(如 Context Engineering 的 ACE/MCE、STOP 的模型依赖性警示),对从事 Agent 和自改进系统设计的从业者具有直接参考价值,建议精读原文以获取完整方法论和案例。
核心信息
Lilian Weng 发表博客,系统阐述 Harness Engineering 作为 AI 递归式自改进(RSI)的近期主战场。文章归纳了三类基础设计模式(Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs),并深入探讨了 Context Engineering(ACE/MCE)、Meta-Harness、Workflow Design(手工与搜索流派)、Self-Improving Harness(STOP 在 GPT-4 有效但在 GPT-3.5/Mixtral 退化)、Evolutionary Search 以及 Darwin Gödel Machine(SWE-bench 从 20% 提升至 50%)等方向。最后指出七大瓶颈,包括弱评估器、记忆生命周期、阴性结果丢失、多样性坍缩、Reward hacking 等。
原始内容
相关动态
Kimi K3 在 SpreadsheetBench 2 上排名第一
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
Mind Lab 开源长文本强化学习项目
Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。
Kimi K3非对称竞争分析
Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...
二年级学生Jo Nagai发现蝴蝶可遗传记忆
日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。
开源模型长期网络能力差距缩小至4-7个月
长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。