# 翁荔：为模型自我改进而设计的Harness工程

AI智识录 · 2026-07-08

<https://ai.podhood.com/ad6b335c-0d4f-4af3-a86b-e9bfa2bfc7fa>

本期解读前OpenAI安全系统副总裁、Thinking Machines Lab联合创始人翁荔（Lilian Weng）的长文《为自我改进而进行的Harness工程》，核心观点是：把大模型比作大脑，围绕它的Harness就是身体与操作系统，负责编排任务、管理记忆、调用工具和执行评估，其设计已成为决定智能体能力上限的关键工程变量。文章回顾了递归自我改进（RSI）从1965年IJ·古德'智力爆炸'设想到2008年Yudkowsky正式定义的脉络，并梳理工作流自动化、文件系统当持久记忆、子智能体与后台作业三大Harness设计模式。在优化路径上，翁荔划出五层递进：从优化提示词、上下文（如ACE、MCE），到工作流设计（AI Scientist）、让AI改写自身Harness代码（STOP、Self-Harness），再到Darwin Gödel Machine等进化搜索（真实软件工程基准从20%刷到50%）和模型权重联合优化。她同时指出七大瓶颈：主观任务难量化评估、长期记忆管理未解、负面结果缺失、多样性崩塌、奖励作弊、长期工程健康指标缺失，以及人类应上移到堆栈顶端担任裁判与监督者。附录以真实水位收尾：PaperBench上AI最高约21%仍未超越人类机器学习博士，RE-Bench中AI两小时爆发力达人类专家四倍，但拉长到八小时以上最顶尖人类仍能反超。

## Questions this episode answers

### 什么是Harness？它和大模型是什么关系？

翁荔在文章中提出，如果把大模型比作超级聪明的大脑，Harness就是给大脑配备的身体或外围操作系统，负责编排任务、决定大脑怎么思考、怎么调用工具、怎么管理记忆、怎么把结果存下来，以及怎么评估自己干得好不好。它已变成高度复杂的软件系统，设计理念接近操作系统，直接决定Claude Code这类顶尖AI编程助手好不好用。

[1:33](https://ai.podhood.com/ad6b335c-0d4f-4af3-a86b-e9bfa2bfc7fa?t=93000)

### 翁荔提出的Harness优化五层递进路径是什么？

播客介绍，Lilian展示了五层递进的优化之路：一开始是优化提示词，后来变成优化上下文，再变成优化工作流，现在更是直接去优化Harness代码本身，甚至是优化优化器本身，最终达到模型权重与Harness的联合优化，比如SAR系统在一个循环里既决定要不要改外壳代码，也决定要不要更新神经网络参数。

[4:22](https://ai.podhood.com/ad6b335c-0d4f-4af3-a86b-e9bfa2bfc7fa?t=262000)

### AI自我改进目前面临哪七大瓶颈？

翁荔在文章第四部分列出七大挑战：主观任务难以量化评估、长达几个月的超级任务中长期记忆管理难题、负面结果缺失导致报喜不报忧、进化循环中多样性崩塌、奖励黑客即钻测试基准空子刷分、代码可维护性等长期工程健康指标缺失，以及最根本的问题——人类应该上移到堆栈顶端，在合适的时间点和抽象层级上当裁判和监督者。

[9:02](https://ai.podhood.com/ad6b335c-0d4f-4af3-a86b-e9bfa2bfc7fa?t=542000)

### PaperBench和RE-Bench显示AI自我改进的真实水平如何？

播客提到，测试AI能否复现顶级学术论文的PaperBench，目前AI最高分也就21%左右，还没超过人类机器学习博士。而考察研究工程环境的RE-Bench显示，AI在两小时内的爆发里能拿到人类专家四倍的得分，但如果战线拉长到八小时或更久，最顶尖的人类专家依然能反超最强的AI。

[11:06](https://ai.podhood.com/ad6b335c-0d4f-4af3-a86b-e9bfa2bfc7fa?t=666000)

## Key moments

- **[0:00] 开场介绍**
- **[0:40] 递归自我改进**
  - [0:40] 递归自我改进（RSI）溯源：1965年IJ古提出"超智能机器"设想，智力爆炸循环如何定义
  - [1:24] 翁荔定义Harness：大模型是"大脑"，Harness是编排任务、管理记忆、调用工具的"身体和操作系统"
- **[2:08] Harness设计模式**
  - [2:23] 顶级Harness三大设计模式：工作流自动化、把文件系统当持久记忆、子智能体与后台作业
- **[4:22] 五层优化进阶**
  - [4:22] Harness优化五层递进：从优化提示词、上下文、工作流，到AI直接改写Harness代码本身
- **[6:02] 工作流设计**
- **[6:39] 自我改写外壳**
  - [7:02] STOP自我改进实验：AI自己领悟出遗传算法等经典策略，但GPT-3.5基座越改越蠢
- **[7:30] 进化搜索**
  - [8:03] Darwin Gödel Machine让智能体大改自身Harness代码，真实软件工程基准得分从20%刷到50%
- **[8:20] 权重联合优化**
- **[8:48] 七大瓶颈**
  - [9:02] 翁荔列出自我改进七大瓶颈之首：主观任务如科研品味难以量化，AI只能在客观打分任务里打转
  - [10:14] 最根本的挑战：人类不该被踢出局，而应上移到堆栈顶端当裁判和监督者
- **[11:06] 基准实测**
  - [11:06] 当前真实水位：PaperBench上AI最高仅21%未超人类博士，RE-Bench八小时后人类专家反超最强AI
- **[11:38] 结尾与广告**

## Topics

自动化AI研究, AI开源与Agent生态

## Mentioned

OpenAI (company), Thinking Machines (company), AI Scientist (product), Claude Code (product), Darwin Gödel Machine (product), Lil'Log (product), PaperBench (product), RE-Bench (product)

## Transcript

### 开场介绍

**Host** [0:00]
Hello 大家好 ， 今天我们要来聊一篇博客 。 这篇文章的作者是 Lilian Weng， 中文名叫翁荔 。 很多关注 AI 圈的小伙伴可能对她不陌生 。

她毕业于北大 ，是 OpenAI 的前研究员 ， 目前 Thinking Machines 的联合创始人。 她的个人博客 Lil'Log 是 AI 研究者的宝藏库 ， 每次更新都会引发圈内热议 ，因为她总是能把最前沿 、 最复杂的 AI 技术趋势梳理得清清楚楚 、 深入浅出 。

今天我们要聊的这篇题 ， 叫做 《 为自我改进而进行的 Harness 工程 》。 整篇文章其实在探讨一个终极问题 ：AI 到底能不能自己改进自己 ？

首先 ， 文章抛出了一个核心概念 ： 递归自我改进 ， 简称 RSI。 这也是硅谷模型圈今年最火的概念 。其实早在 1965 年， 一位叫 IJ 顾的学者就提出过 " 超智能机器 " 的设想 。他说只要造出一台比人类聪明的机器 ， 这台机器就能设计出更好的机器 ； 以此类推 ， 智力就会爆炸 。

### 递归自我改进

**Host** [1:02]
到了 2008 年， 另一位叫 Yudkowsky 的学者把这个循环正式定义为 " 递归自我改进 "，也就是 AI 用它现在的聪明才智去优化那个能产生它智能的底层机制 。

在现在的 AI 大模型时代 ， 这种 " 自我改进 " 不仅仅是指 AI 直接去修改自己的脑子 ，也就是神经网络里的权重 。

它更多指的是 AI 去改进自己训练的流水线 ，以及它在真实世界里运行的系统 。 这就引出了文章的主角 Harness。

想象一下， 如果大模型是一个超级聪明的大脑 ， 那 Harness 就是给这个大脑配备的四只 " 眼睛 "： 记忆备忘录和执行计划的 " 身体 " 或者外围操作系统 。

它负责编排任务 ， 决定大脑怎么思考 、 怎么调用工具 、 怎么管理记忆 、 怎么把结果存下来 ，以及怎么评估自己干得好不好 。

在早期的 AI 圈 ， 大家觉得只要有大模型加上记忆 、 工具和行动就行了 。 但现在 ，Harness 已经变成了一个高度复杂的软件系统 ， 它的设计理念更接近于操作系统 。

### Harness设计模式

**Host** [2:08]
可以说 ， 它直接决定了像 Claude Code 这样的顶尖 AI 编程助手到底好不好用 。 搞明白了大脑和身体的关系 ， 我们跟着作者进入第二部分 ， 看看现在顶级的 Harness 系统 ，也就是这副 AI 身体 ， 都有哪些设计模式 。

第一种模式叫 " 工作流自动化 "。 这就像给 AI 设定了一个工作打工循环 ： 你先计划 ， 然后去执行 ； 干完自己观察 、 测试一下， 哪里不好就改进 ， 然后再接着干 。

而且在干活的过程中， 它还可以主动 " 停下来 "， 向人类老板请求澄清任务细节 。 第二种模式叫 " 把文件系统当成持久记忆 "。

我们都知道你和 AI 聊天 ， 说的话太多 ， 它就容易 " 断片 "。 所以现在聪明的设计是 ： 不把所有鸡毛蒜皮的日志全塞进 AI 当前的 " 对话窗口 " 里 ，而是让 AI 像个真正的程序员一样 ， 熟练使用命令行工具 ， 把自己的实验日志 、 代码修改记录 、 错误追踪都存到电脑硬盘的文件里 。

这样它就不会被 " 塞满 "， 随时可以去硬盘里翻找过去的经验 。 第三种模式叫 " 子智能体和后台作业 "。

主 AI 如果遇到一个大活 ， 它可以分身 ， 派好几个小 AI 同时去搜索不同的假设 ， 或者去后台默默跑实验 ， 完成孤立的任务 。

这种模式最大的好处就是 ： 它都记在文件里 ， 就算中途被打断了 ， 随时也能恢复进度 ， 非常靠谱 。

作者在这里还专门举了 Coding Agent 的例子 。 现在的顶尖写代码 AI， 它的工具箱里不仅有 " 读写文件 " 的能力 ， 还能跑终端命令 、 能上网搜索 、 能调用 Git 管理代码 、 能唤起后台进程 ， 甚至能把工作委派给其他智能体 。

简直就是一个 " 全栈工程师 " 的终极配置 。 那么 ， 这时候可能有人会问了 ： 我们花这么大精力去搞这套外壳 Harness，而不去搞核心大脑 ， 对吗 ？Lilian 指出 ，在短期内 ， 这就是通往 AI 递归自我改进的第一步 。

因为我们必须先搞出一套顶级的 " 元方法论 "，也就是让 AI 学会怎么获得更好答案的机制 。 当然 ，在未来 ， 外壳里的一些技巧可能会渐渐被吸收到核心大脑的直觉里 ，但这套外围的操作系统和工具接口 ， 依然是不可或缺的 。

这也就来到了文章篇幅最大的第三部分 ：Harness 到底该怎么优化 。Lilian 给我们展示了五层递进的练习之路 。 一开始 ， 大家只是在 " 优化提示词 "， 后来变成了 " 优化上下文 "， 再变成 " 优化工作流 "， 现在更是直接去优化 Harness 代码 ， 甚至是优化 " 优化器 " 本身 。

### 五层优化进阶

**Host** [4:44]
咱们先说第一条路 ： 上下文工程 。 这里有三种主流做法 。 第一种叫 ACE， 它把 AI 的上下文当成一本不断演化的剧本 。

它不会每次都让 AI 重写一大堆提示 ，而是专门有个 " 反思员 " 和 " 图书管理员 "， 从 AI 成功的经验和失败的教训里提炼出关键要点 ， 然后像更新小纸条一样增量更新 AI 的知识库 ， 避免遗忘 。

第二种叫 MCE， 这招更绝 。 它把 " 怎么管理上下文 " 这套动作变成了一种 " 技能 "。 它把具体的知识和搜索 、 过滤这些动作分离开 。

系统通过两层考试来选拔技能 ，不仅在底层考技能本身好不好用 ， 还在上层考哪种技能的组合最强 。

元智能体甚至能把以前的技能交叉组合 ， 生出新的技能 。 第三种叫 Meta-Harness， 这就是 " 套娃 " 了 。 让一个写代码的 AI 去直接修改 Harness 的代码 ，也就是说用一个 Harness 去优化另一个 Harness， 通过一次次迭代 ， 自动寻找一套完美的 " 保存 、 检索信息 " 的代码逻辑 。

实验证明 ，AI 写的这套代码外壳 ， 利用人类工程师留下的设计空间 ，在很多测试上表现非常惊艳 。 第二条路是工作流设计 。

### 工作流设计

**Host** [6:02]
这就好比给 AI 安排什么样的 " 打工流水线 "。 有人工设计的 ， 比如非常有名的 AI Scientist 项目 ， 它完全模仿人类科学家 ， 从想点子 、 写代码 、 跑实验 ， 一直到写论文 ， 甚至当评审专家全包了 。

还有的系统主打 " 严谨 "， 比如 Scientist One， 要求 AI 说的每一句话 、 每一个数据 ， 都必须能查到证据链 。 更高级的是自动化搜索工作流 ，不再让人类来画流程图 ，而是让一个元智能体自己去把工作流设计当成一个优化问题 ， 自己写代码 、 跑测试 ， 最后留下最好用的那一套流程图 。

### 自我改写外壳

**Host** [6:39]
第三条路是自我改进的 Harness。 既然外壳也是代码写的 ， 那能不能让 AI 自己改自己的外壳代码呢 ？ 文章提到了一个叫 STOP 的早期尝试 ， 它让一个 " 改进器 " 去改进自己 。

结果很有趣 ，AI 自己领悟出了类似于遗传算法 、 模拟退火这些人类计算机科学里非常经典的策略 。

但这里有个坑 ： 只有像 GPT-4 这样绝对聪明的大脑 ， 才能玩转这种自我进化 。 如果基座大脑太弱 ， 比如用早期的 GPT-3.5， 越改反而越蠢 。

后来还有个叫 Self-Harness 的系统 ， 让 AI 自己找漏洞 ， 然后像打补丁一样给自己的外壳提建议 ， 做回归测试 ， 确认没退化了再实装 。

当然 ， 作者也提醒 ， 让 AI 自己改自己的核心代码 ， 就像让它自己给自己做外壳手术 ， 风险还是挺大的 。

权限管理和安全性必须放在循环之外 。 第四条路叫 " 进化搜索 "。 如果你的搜索空间巨大 、 形状怪异 、 找不到清晰的优化梯度 ， 那就用 " 进化论 " 的那套逻辑 。

### 进化搜索

**Host** [7:42]
比如搞个候选程序池 ， 让 AI 像繁衍后代一样 ， 把代码稍微 " 变异 " 一下 ： 好的留下， 差的淘汰 。

从早期的 PromptBreaker（ 进化提示词 ）， 到现在像 Darwin Gödel Machine（ 达尔文 · 戈德尔机器 ） 这样的系统 ， 它直接允许智能体大刀阔斧地修改自己的 Harness 仓库代码 。

表现好的 AI 甚至能在极其困难的真实软件工程基准测试上， 把得分从 20% 硬生生刷到了 50%。 不过 ， 这招也有缺陷 ： 如果你的评判标准太模糊 ， 或者跑一次测试太慢 ， 这套 " 进化系统 " 就转不动了 。

### 权重联合优化

**Host** [8:20]
最后， 第五条路 ，是大结局级别的 " 双键合璧 "： 模型权重联合优化 。在一个循环里 ，有个叫 SAR 的系统不仅决定要不要改外壳代码 ， 还决定要不要更新自己大脑里的神经网络参数 。

虽然目前的一些实验还有很多混淆的因素和不完善的地方 ， 比如训练稳定性和大名鼎鼎的古德哈特定律问题 ，但这无疑指明了一个极其诱人的方向 。

好 ， 说到这里 ， 可能大家觉得 ：AI 这就要上天了 ， 马上要造出超越人类的 " 超级神明 " 了 。Lilian 在文章的第四部分 ， 非常清醒地列出了目前横在这条路上的七大瓶颈和挑战 。

### 七大瓶颈

**Host** [9:02]
第一个挑战 ： 裁判太弱 ， 标准太模糊 。AI 要 " 自我改进 "， 必须得知道什么是好 ， 做做客观选择题 ， 跑跑代码 ，有没有报错 ， 这个 " 好评判 "。

但如果是搞科研呢 ？ 什么是好的研究品味 ， 什么是真正有新意的东西 ， 这些太难量化了 。 目前的自我改进 ， 只能在那些能客观打分的任务里打转 。

第二个挑战 ： 长期的记忆生命周期 。 搞个一两天的项目还行 ， 如果是长达几个月的超级任务 ， 怎么管理这海量的上下文不崩溃 ？

长期记忆依然是个巨大的难题 。 第三个挑战 ： 总是 " 报喜不报忧 " 的负面结果缺失 。 这和人类社会有点像 ，AI 现在的文献和系统里很难容忍失败 。

大模型很难判断在什么时候应该主动放弃一个假设或者报告 ， 一条路走不通 。 只有学会保留失败尝试 ， 才能真正去探索未知 。

第四个挑战 ： 多样性崩塌 。 就像物种进化 ， 如果环境太单一 ， 最后活下来的都是一个样 。AI 在进化的循环里 ，也很容易陷入一种模式 ： 大家都去钻某个能拿到高分的已知套路 ， 失去了探索新解法的多样性 。

第五个挑战 ： 奖励黑客 ，也就是作弊 。AI 太聪明了 ， 如果你给它定个分数目标 ， 它可能不会去解决真正的问题 ，而是去钻测试基准的空子 ， 去拿高分 。

这要求我们必须把裁判和权限控制放在进化循环之外 。 第六个挑战 ： 长期成功怎么衡量 。AI 目前只会盯着眼前的得分 ，但一个好的软件系统 ， 代码要容易维护 ， 产权边界要清晰 ， 迁移成本要低 。

这些长期的工程健康指标 ， 短视的优化循环根本看不到 。 第七个挑战 ，也是最重要的 ： 人类到底扮演什么角色 。Lilian 认为 ，在这个过程中， 我们人类不应该被 " 踢出局 "。

相反 ， 我们应该上移到堆栈的顶端 ，在合适的时间点和抽象层级上去当裁判和监督者 ， 给系统提供方向 。

在文章的最后附录里 ， 作者还列举了目前最前沿的几个测试基准 ， 看看 AI 的真实水平 。 比如测试 AI 能不能复现顶级学术会议论文的 PaperBench， 目前的 AI 最高分也就是 21% 左右 ， 还没超过人类机器学习博士 。

### 基准实测

**Host** [11:22]
还有一个考察研究工程环境的 RE-Bench， 目前的人工智能在两小时内的爆发里能拿到人类专家四倍的得分 ，但如果战线拉长到八小时或者更久 ， 最顶尖的人类专家依然能反超最强的 AI。

好了 ， 今天的分享就到这里 。 欢迎订阅 《AI 知识路 》， 获取最新鲜的 AI 领域最新知识 。 最后插播一个广告 ： 主播自己的 AI 创业产品 UNAVI， 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡录音豆 ， 随时随地帮您解读日常会议与沟通背后的深意 。

### 结尾与广告

**Host** [11:58]
锁定关键信息的 Agent 应用已经正式上线 ， 最新的版本也支持了直接给它播客链接 ， 它就能轻松完成转写 、 总结 、 分析 ， 甚至多个播客的关联解读和分析 。

如果你有兴趣 ， 欢迎在本播客的公告栏查看体验方式 ， 我们下期见 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
