Lilian Weng 新文深读:当 Harness 本身成为被优化的对象

《Harness Engineering for Self-Improvement》深度消化:递归自我改进不会从模型改写自己的权重开始,而是从部署层开始。被优化对象的爬升路径(prompt → context → workflow → harness 代码 → 优化器代码),以及为什么评估器必须留在循环之外。

原文:Harness Engineering for Self-Improvement,Lilian Weng(Thinking Machines 联合创始人,前 OpenAI),2026-07-04。这是「researcher-deepdive」系列第一篇:不做摘要,做消化——读完原文的人也应该能从这篇带走新东西。

上一篇《Agent 工程七问》的结论是一个动作:把真相移到模型外面——状态进日志、权限进沙箱、成败进世界终态。Lilian Weng 这篇文章接住了这个结论,然后问了一个更危险的问题:移到外面的那一层,自己开始进化了怎么办?

原文在争什么

经典的递归自我改进(RSI)叙事——从 Good (1965) 到 Yudkowsky (2008)——想象的是模型直接改写自己的权重,智能爆炸。Weng 反对的正是这个默认图景。她的主张:

“the near-term path of RSI is unlikely to start as a model directly rewriting its weights.”

近期的自我改进不会发生在权重层,而是发生在部署层:harness——包裹在裸模型外面、决定它如何思考规划、调用工具、感知与管理上下文、存储产物、评估结果的那套系统。她给出的预测是一条爬升路径,也是全文最值得记住的一句话:被优化的对象正在从

指令 prompt → 结构化上下文 → workflow → harness 代码 → 优化器代码

一级一级往上爬。每爬一级,“写这层东西”的工作就从人手里转移到模型手里一分。Prompt engineering 已经基本被模型内化而消亡——她认为很多 harness 技巧终将走上同一条路,但目标、约束、上下文的规约(specification)不会消失,因为那是人对世界意图的表达,模型没法替你想要什么。

第一性原理拆解:这是”谁来优化优化器”的老问题

顶级原理望远镜拆,这篇文章主要在三条上做文章:

① 搜索与优化——解空间换了。 ADAS 把 agent 设计交给”元 agent”用代码搜索;AFlow 把 workflow 表示成图(节点是 LLM 调用,边是代码逻辑)然后跑 MCTS;DGM(Darwin Gödel Machine)直接进化 harness 代码库,在模型冻结不动的前提下把 SWE-bench Verified 从 20% 推到 50%。注意这个实验设计的锋利之处:模型没变,变的全是外面那层——这是”harness 是独立于智能的第二个杠杆”最干净的证据。这一整族方法的共同祖先不是新东西,是 meta-learning / AutoML / Schmidhuber 的 Gödel machine:谁来优化优化器。新的只是搜索算子从梯度换成了”会写代码的 LLM”,解的表示从超参数换成了文件系统里的一个目录。

③ 目标函数即命运——而且现在目标函数会被”进化”钻空子。 七问里讲过 reward hacking,但那是单层的:模型钻验证器的空子。这篇揭示的是双层版本:当 harness 本身在被优化时,优化压力会自动流向评估器的每一条缝隙——过拟合单测、利用 judge 的偏好、利用 benchmark 的 artifact。所以她反复强调一条边界:evaluator 和 permission control 必须坐在被进化的循环之外。AHE 的做法很具体:每次 harness 编辑是一个”文件级的、可证伪的 claim”,但 runs/tracer/verifier/模型配置全部只读。

⑪ 反馈闭环——但闭环有能力门槛。 STOP(Self-Taught Optimizer)让改进器改进自己,用 GPT-4 时真的自己发现了遗传算法、beam search、模拟退火;换成 GPT-3.5 或 Mixtral 就直接退化。递归结构本身不产生智能,能力是闸门:“intelligence is still the core”。更微妙的是 Lin et al. 2026 的解耦发现:从 9B 模型到 Opus 4.6,“更新 harness 的能力”几乎是平的,但”从 harness 获益的程度”非单调——中档模型获益最大。强模型不太需要拐杖,弱模型撑不起拐杖。

与七问的连接与一处真正的冲突

连接是直接的:七问的公理是”LLM 是无状态随机函数,所以把真相移到外面”。Weng 的文章等于在说:你们移出去的那些东西——loop 结构、上下文管线、工具编排——本身构成了一个新的可优化空间,而且它是文本和代码,比权重好改、好审计、好回滚得多。这就是为什么 RSI 会从这里开始:不是因为这里最重要,而是因为这里梯度最便宜

冲突在第 6 节。七问里我把上下文工程当作 harness 的工程责任——窗口外的系统维护状态,每轮喂进去。Weng 的立场更激进:context engineering “will and should become a core part of intelligence”——上下文的生命周期管理最终应该被内化成模型能力的一部分,就像 prompt engineering 被内化一样。这两个立场描绘的终局不同:一个是”永远的 OS 层”,一个是”暂时的脚手架”。我目前站在中间:机制会内化,接口不会——模型可能学会自己决定压缩什么、检索什么,但”哪些文件、哪些工具、哪些权限可见”永远是外部规约。这和她自己”specification 不会消失”的论断其实是自洽的,她只是没有把这条线画穿。

我的判断

可信的部分。 这是一篇 survey 型长文,每个论断都挂着具体系统(ACE/MCE/ADAS/AFlow/STOP/DGM/AHE),单篇结果可以怀疑,但”被优化对象在爬层级”这个趋势有多点交叉验证。她对证据强度的标注也诚实——SIA 的权重+harness 联合优化她明说是 “provisional”。

需要打折的部分。 第一,立场:Weng 是 Thinking Machines 的联合创始人,一家做部署层/产品层的公司——“harness 和裸智能一样重要”这个论断恰好抬高她所在层的价值,这不构成反驳,但构成先验。第二,benchmark 锚点太窄:AHE、Meta-Harness 的证据几乎全在 Terminal-Bench-2 上,且 AHE 在 Hard 档就输给了人类设计——自动 harness 优化目前赢在中等难度的密集小改进,不是赢在难题。第三,别漏掉附录里最反炒作的一个数字:RE-Bench 上 agent 在 2 小时预算下是人类的 4 倍,但 8 小时、32 小时预算下人类反超。自我改进循环目前擅长的是”短平快 + 可验证”,这正好是她列的七个瓶颈(模糊评估器、负结果、多样性坍缩、长期质量……)的镜像。

一个她没有展开的推论。 如果 harness 是文本+代码,那么 harness 的进化史(git log)就是一份免费的、可审计的”自我改进轨迹数据集”。谁在生产环境里积累了最长的 harness 进化历史,谁就攒下了下一代模型内化这些能力时最稀缺的训练信号。这可能比”harness 本身好用”更值钱。

行动

  1. 在 verl 里找这条边界。 我正在读 verl 源码——现在多了一个具体问题:reward function / verifier 在代码结构上和被训练的 policy 隔离得干不干净?RLVR 的 sandbox 是七问讲的”真相在外面”,Weng 补的是”评估器在循环外”——对着 verl/workers/ 里 reward model 和 rollout 的关系验证这两条。
  2. 做一次最小的 self-harness 实验。 她描述的 Self-Harness 循环(挖失败 → 有界提案 → 双 split 验证)可以直接搬到自己的 Claude Code 配置上:从最近的会话里挖三个重复失败模式,提一个 CLAUDE.md/skill 的有界修改,用一组 held-out 任务验证无回归再合入。这就是”decision observability”的个人版。
  3. 补两篇源头论文:STOP(改进器改进自己 + 能力闸门)和 DGM(冻结模型、只进化 harness 的干净实验)。它们是这篇文章论证结构的两根承重柱。

下一篇候选已经在队列里:她 6 月 24 日的《Scaling Laws, Carefully》。