# Lilian Weng 分享：如何通过 Harness Engineering 推动 AI 的递归式自我改进 (RSI) ？ 这篇 blog 是她把最近散落在 auto-research、自改进 agent、进化式程序搜...

- 来源：Meng Shao
- 发布时间：2026-07-07 14:49
- AIWatch 分数：67
- AIWatch 标记：本周精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01kwxvs3nye54cjpbqwnwzhg0z
- 原文链接：https://x.com/shao__meng/status/2074385362777235878

## 精选理由

高信息密度，值得细读

## AI 摘要

Lilian Weng 系统梳理了通过 Harness Engineering 推动 AI 递归式自我改进（RSI）的方法。她认为 RSI 短期内不会从模型直接重写权重开始，而是从模型改进其部署系统（harness）开始。文章归纳了 Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs 三类基础设计模式，并深入探讨了 Context Engineering、Workflow Design、Self-Improving Harness、Evolutionary Search 等优化路径。最后指出了评估器弱、记忆退化、多样性坍缩等七大瓶颈。对开发者而言，这提供了从系统设计角度实现 AI 自我改进的实用框架。
核心观点：
1. STOP 递归改进在 GPT-4 上有效，但在 GPT-3.5/Mixtral 上反而退化，说明基座模型强度是关键前提。
2. Self-Harness 通过 weakness mining、bounded edits 和 held-in/held-out 双重回归测试，能学到 model-specific 指令。
3. Darwin Gödel Machine 在 SWE-bench Verified 上从 20% 提升到 50%，但仅在评估易量化的领域有效。

## 正文

这篇 blog 是她把最近散落在 auto-research、自改进 agent、进化式程序搜索等方向的工作进行的一次收敛沉淀，推荐大家阅读：
https://lilianweng.github.io/posts/2026-07-04-harness/

# 核心论点：Harness 是 RSI 的近期主战场

Lilian 认为，真正的 RSI 短期内不会从"模型直接重写自身权重"开始，而会从"模型改进部署它的系统"开始。这里的"部署系统"就是 harness——围绕基座模型编排执行、决定其如何思考/规划/调用工具/感知上下文/管理记忆/评估结果的系统。Claude Code、Codex 等成功 coding agent 已经证明：harness 层与基座智能同等重要。

这一定位把文章的视野从"模型智能"转向"运行时与软件系统设计"，并明确了一条优化对象的演进路径：
指令 prompt → 结构化 context → workflow → harness 代码 → optimizer 代码

# Harness 设计模式

文章归纳了三类基础设计模式，强调应当简单、通用、贴近已有软件工程实践（从而受益于预训练知识），并把 harness 类比为操作系统——封装复杂逻辑、对外接口简洁。
1. Workflow Automation：plan–execute–observe/test–improve 的目标导向循环，运行在 agent runtime 上而非静态 prompt。
2. File System as Persistent Memory：长程任务中日志、diff、轨迹远超上下文窗口，应将持久状态写入文件，而非全塞进 context。读写文件（通常经 bash）是 LLM 的基础能力，自然受益于模型进步。
3. Sub-agent & Backend Jobs：显式、可检视的并行——子 agent 输出应落盘为文件/日志/状态记录，使其可中断恢复、可被主 agent 推理回溯。

Coding agent 案例显示，主流 harness 的工具集已经稳定：文件系统、shell、LSP/git、外部 context（MCP/Skills）、web、artifacts、后台进程、子 agent 委派。

# Harness 优化：从 context 到 meta-harness

1. Context Engineering
长程任务中 context 会爆炸。两条进化的脉络：
· ACE（Agentic Context Engineering）：把 context 视为"演化的 playbook"而非不断加长的 prompt。Generator/Reflector/Curator 三组件维护一组 (identifier, description) 结构化条目，定期去重精炼。仍是手工规则。
· MCE（Meta Context Engineering）：双层优化——内层在给定 skill 下优化 task context，外层在验证集上搜索最优 skill（即 context 管理机制本身）。skill 被实例化为文件目录（skill.md + 动态 rollout），由 meta-agent 在 coding 环境中做"交叉进化"。机制与内容解耦是关键。
· Meta-Harness：再深一层——优化对象是"决定如何存取、呈现信息的代码"。Proposer 本身是 coding agent，最终输出 Pareto 前沿上的 harness 候选集。结论是：一旦 harness 设计成为可执行搜索空间，强 coding agent 就能利用人类工程师使用的同一设计空间。

2. Workflow Design
· 手工流派：AI Scientist（idea→实验→写作→评审全流水线）、ScientistOne（以可验证性为核心约束，Chain-of-Evidence 审计每条 claim）、Autodata（challenger/weak solver/strong solver/verifier，制造"strong 通、weak 不通"的恰到好处难度数据，但作者指出它更像"间接蒸馏"，RSI 味不足）。
· 搜索流派：ADAS 把 agent 设计本身作为优化问题，meta-agent 用代码生成新 workflow 并自 refine；AFlow 把 workflow 表为图，用 MCTS 优化，在 QA/code/math 上超过人工设计与 ADAS。

3. Self-Improving Harness
· STOP（Zelikman 2023）：递归地"改进改进器" $ I_t = I_{t-1}(\hat u, I_{t-1}; M)$。重要警示——STOP 在 GPT-4 上有效，在 GPT-3.5/Mixtral 上反而退化。递归结构本身不够，基座必须足够强。
· Self-Harness：propose–evaluate–accept 闭环，三阶段——weakness mining（聚类失败模式，区分表面同因异果）、harness proposal（在受约束的可编辑面上提 bounded edits）、proposal validation（held-in 与 held-out 双重回归测试才合并）。实验显示它能学到针对不同基座模型弱点的 model-specific 指令。作者警惕：若允许编辑 OS 系统就会破坏抽象边界，权限与安全层必须在该循环之外。

4. Evolutionary Search
适合"搜索空间大、形状怪、难用梯度但易评估"的场景。从 Promptbreeder/GEPA 的 prompt 进化，到 AlphaEvolve 的 coding agent 进化（# EVOLVE-BLOCK 标记可变区域、meta-prompt 共进化），再到 ShinkaEvolve 的样本效率改进（parent 采样、embedding 新颖性拒采、meta-scratchpad 模式复用）。

5. Darwin Gödel Machine（DGM）
把进化目标明确指向"可编辑的 harness 代码库"，agent 被允许修改自己的 harness；Hyperagents 再加一层 meta-agent 控制任务 agent 的生成。DGM 在 SWE-bench Verified 上从 20% 涨到 50%。局限：仅在"自动可评估、fitness 易量化"的领域（矩阵乘、GPU kernel、调度、竞赛）表现好；评估慢/模糊/启发式为主的领域吃力；算力与效率仍是问题。

6. Joint Optimization with Model Weights
SIA 是早期尝试：Meta-Agent 提初始 harness、Task-Specific Agent 执行、Feedback-Agent 决定下一轮改 harness 还是改权重。作者明确指出其实验有混杂因素（任务 agent 用 gpt-oss-120b，meta/feedback 用 Sonnet 4.6；baseline 偏弱），方向有趣但证据尚属初步，训练稳定性与 Goodhart 效应仍未解。

# 未来挑战

Trehan & Chopra 2026 的最小 scaffolding 实验归纳出六种反复出现的失败模式：偏向训练数据默认值、执行压力下的实现漂移、长程记忆退化、过度乐观（"数字胶带"+ 宣布胜利）、领域直觉不足、科学品味薄弱。在此基础上，作者列出通向完整 RSI 的七大瓶颈：

1. 弱且模糊的评估器：当前自改进 loop 只在指标客观可测时好用，研究品味/新颖性/长期科学价值难以度量。

2. Context 与记忆生命周期：context engineering 应当成为智能的一部分，而非仅停留在软件层。

3. 阴性结果：训练数据成功偏置严重，模型不擅于放弃假设、报告负结果；harness 应让失败易保留——失败是裁剪搜索空间最好的信号。

4. 多样性坍缩：进化与 RL 易剥削已知高奖励模式，需要防种群塌缩为同一解的变体——这在开放式研究中尤为致命。

5. Reward hacking：评估器与权限控制必须坐在进化 loop 之外，配 held-out 测试、trace 审计、关键决策点人工复核。

6. 长期成功：sandbox RLVR 训练几乎捕捉不到可维护性、所有权边界、迁移成本、向后兼容、未来调试负担。

7. 人的角色：人应当沿栈上移而非被移除——在正确的时机、正确的抽象层提供 oversight。
