Signal Brief

Harness工程与AI自改进

Lilian Weng 发表博客,系统阐述 Harness Engineering 作为 AI 递归式自改进(RSI)的近期主战场。文章归纳了三类基础设计模式(Workflow Automation、File System as Persistent Memory、Sub-agent & Backe...

twitter关注列表 meng shao (@shao__meng) 发布 2026-07-07 收录 2026-07-07 观察

一句话判断

系统梳理了 Harness Engineering 在递归自改进中的具体技术路径(如 Context Engineering 的 ACE/MCE、STOP 的模型依赖性警示),对从事 Agent 和自改进系统设计的从业者具有直接参考价值,建议精读原文以获取完整方法论和案例。

核心信息

Lilian Weng 发表博客,系统阐述 Harness Engineering 作为 AI 递归式自改进(RSI)的近期主战场。文章归纳了三类基础设计模式(Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs),并深入探讨了 Context Engineering(ACE/MCE)、Meta-Harness、Workflow Design(手工与搜索流派)、Self-Improving Harness(STOP 在 GPT-4 有效但在 GPT-3.5/Mixtral 退化)、Evolutionary Search 以及 Darwin Gödel Machine(SWE-bench 从 20% 提升至 50%)等方向。最后指出七大瓶颈,包括弱评估器、记忆生命周期、阴性结果丢失、多样性坍缩、Reward hacking 等。

原始内容

Lilian Weng 分享:如何通过 Harness Engineering 推动 AI 的递归式自我改进 (RSI) ? 这篇 blog 是她把最近散落在 auto-research、自改进 agent、进化式程序搜索等方向的工作进行的一次收敛沉淀,推荐大家阅读: https://t.co/jGF7DoyPQI # 核心论点:Harness 是 RSI 的近期主战场 Lilian 认为,真正的 RSI 短期内不会从"模型直接重写自身权重"开始,而会从"模型改进部署它的系统"开始。这里的"部署系统"就是 harness——围绕基座模型编排执行、决定其如何思考/规划/调用工具/感知上下文/管理记忆/评估结果的系统。Claude Code、Codex 等成功 coding agent 已经证明:harness 层与基座智能同等重要。 这一定位把文章的视野从"模型智能"转向"运行时与软件系统设计",并明确了一条优化对象的演进路径: 指令 prompt → 结构化 context → workflow → harness 代码 → optimizer 代码 # Harness 设计模式 文章归纳了三类基础设计模式,强调应当简单、通用、贴近已有软件工程实践(从而受益于预训练知识),并把 harness 类比为操作系统——封装复杂逻辑、对外接口简洁。 1. Workflow Automation:plan–execute–observe/test–improve 的目标导向循环,运行在 agent runtime 上而非静态 prompt。 2. File System as Persistent Memory:长程任务中日志、diff、轨迹远超上下文窗口,应将持久状态写入文件,而非全塞进 context。读写文件(通常经 bash)是 LLM 的基础能力,自然受益于模型进步。 3. Sub-agent & Backend Jobs:显式、可检视的并行——子 agent 输出应落盘为文件/日志/状态记录,使其可中断恢复、可被主 agent 推理回溯。 Coding agent 案例显示,主流 harness 的工具集已经稳定:文件系统、shell、LSP/git、外部 context(MCP/Skills)、web、artifacts、后台进程、子 agent 委派。 # Harness 优化:从 context 到 meta-harness 1. Context Engineering 长程任务中 context 会爆炸。两条进化的脉络: · ACE(Agentic Context Engineering):把 context 视为"演化的 playbook"而非不断加长的 prompt。Generator/Reflector/Curator 三组件维护一组 (identifier, description) 结构化条目,定期去重精炼。仍是手工规则。 · MCE(Meta Context Engineering):双层优化——内层在给定 skill 下优化 task context,外层在验证集上搜索最优 skill(即 context 管理机制本身)。skill 被实例化为文件目录(skill.md + 动态 rollout),由 meta-agent 在 coding 环境中做"交叉进化"。机制与内容解耦是关键。 · Meta-Harness:再深一层——优化对象是"决定如何存取、呈现信息的代码"。Proposer 本身是 coding agent,最终输出 Pareto 前沿上的 harness 候选集。结论是:一旦 harness 设计成为可执行搜索空间,强 coding agent 就能利用人类工程师使用的同一设计空间。 2. Workflow Design · 手工流派:AI Scientist(idea→实验→写作→评审全流水线)、ScientistOne(以可验证性为核心约束,Chain-of-Evidence 审计每条 claim)、Autodata(challenger/weak solver/strong solver/verifier,制造"strong 通、weak 不通"的恰到好处难度数据,但作者指出它更像"间接蒸馏",RSI 味不足)。 · 搜索流派:ADAS 把 agent 设计本身作为优化问题,meta-agent 用代码生成新 workflow 并自 refine;AFlow 把 workflow 表为图,用 MCTS 优化,在 QA/code/math 上超过人工设计与 ADAS。 3. Self-Improving Harness · STOP(Zelikman 2023):递归地"改进改进器" $ I_t = I_{t-1}(\hat u, I_{t-1}; M)$。重要警示——STOP 在 GPT-4 上有效,在 GPT-3.5/Mixtral 上反而退化。递归结构本身不够,基座必须足够强。 · Self-Harness:propose–evaluate–accept 闭环,三阶段——weakness mining(聚类失败模式,区分表面同因异果)、harness proposal(在受约束的可编辑面上提 bounded edits)、proposal validation(held-in 与 held-out 双重回归测试才合并)。实验显示它能学到针对不同基座模型弱点的 model-specific 指令。作者警惕:若允许编辑 OS 系统就会破坏抽象边界,权限与安全层必须在该循环之外。 4. Evolutionary Search 适合"搜索空间大、形状怪、难用梯度但易评估"的场景。从 Promptbreeder/GEPA 的 prompt 进化,到 AlphaEvolve 的 coding agent 进化(# EVOLVE-BLOCK 标记可变区域、meta-prompt 共进化),再到 ShinkaEvolve 的样本效率改进(parent 采样、embedding 新颖性拒采、meta-scratchpad 模式复用)。 5. Darwin Gödel Machine(DGM) 把进化目标明确指向"可编辑的 harness 代码库",agent 被允许修改自己的 harness;Hyperagents 再加一层 meta-agent 控制任务 agent 的生成。DGM 在 SWE-bench Verified 上从 20% 涨到 50%。局限:仅在"自动可评估、fitness 易量化"的领域(矩阵乘、GPU kernel、调度、竞赛)表现好;评估慢/模糊/启发式为主的领域吃力;算力与效率仍是问题。 6. Joint Optimization with Model Weights SIA 是早期尝试:Meta-Agent 提初始 harness、Task-Specific Agent 执行、Feedback-Agent 决定下一轮改 harness 还是改权重。作者明确指出其实验有混杂因素(任务 agent 用 gpt-oss-120b,meta/feedback 用 Sonnet 4.6;baseline 偏弱),方向有趣但证据尚属初步,训练稳定性与 Goodhart 效应仍未解。 # 未来挑战 Trehan & Chopra 2026 的最小 scaffolding 实验归纳出六种反复出现的失败模式:偏向训练数据默认值、执行压力下的实现漂移、长程记忆退化、过度乐观("数字胶带"+ 宣布胜利)、领域直觉不足、科学品味薄弱。在此基础上,作者列出通向完整 RSI 的七大瓶颈: 1. 弱且模糊的评估器:当前自改进 loop 只在指标客观可测时好用,研究品味/新颖性/长期科学价值难以度量。 2. Context 与记忆生命周期:context engineering 应当成为智能的一部分,而非仅停留在软件层。 3. 阴性结果:训练数据成功偏置严重,模型不擅于放弃假设、报告负结果;harness 应让失败易保留——失败是裁剪搜索空间最好的信号。 4. 多样性坍缩:进化与 RL 易剥削已知高奖励模式,需要防种群塌缩为同一解的变体——这在开放式研究中尤为致命。 5. Reward hacking:评估器与权限控制必须坐在进化 loop 之外,配 held-out 测试、trace 审计、关键决策点人工复核。 6. 长期成功:sandbox RLVR 训练几乎捕捉不到可维护性、所有权边界、迁移成本、向后兼容、未来调试负担。 7. 人的角色:人应当沿栈上移而非被移除——在正确的时机、正确的抽象层提供 oversight。 ![photo](https://pbs.twimg.com/media/HMmyeNbbUAAzpHu.jpg) > **引用原帖 Lilian Weng (@lilianweng):** > new post on harness engineering for AI self-improvement: https://t.co/ZYvGfVs61k > It is hard to forecast how much the future of RSI will rely on harnesses. Likely harness engineering will evolve in the direction of self-improvement and enable auto-research, and, in turn, smarter models keeps harnesses simple. > Even when many harness improvement get eventually internalized into core model, the need to specify goals and context will not disappear. > https://x.com/lilianweng/status/2074372369213428144

相关动态

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
03

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...

twitter关注列表2026-07-18#AI#模型#技术突破
观察
04

二年级学生Jo Nagai发现蝴蝶可遗传记忆

日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。

twitter关注列表2026-07-18#研究#技术突破#信息
值得跟进
05

开源模型长期网络能力差距缩小至4-7个月

长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。

twitter关注列表2026-07-17#模型#技术突破#AI安全
观察