开场介绍0:00
Hello 大家好 , 今天我们要来聊一篇博客 。 这篇文章的作者是 Lilian Weng, 中文名叫翁荔 。 很多关注 AI 圈的小伙伴可能对她不陌生 。
她毕业于北大 ,是 OpenAI 的前研究员 , 目前 Thinking Machines 的联合创始人。 她的个人博客 Lil'Log 是 AI 研究者的宝藏库 , 每次更新都会引发圈内热议 ,因为她总是能把最前沿 、 最复杂的 AI 技术趋势梳理得清清楚楚 、 深入浅出 。
今天我们要聊的这篇题 , 叫做 《 为自我改进而进行的 Harness 工程 》。 整篇文章其实在探讨一个终极问题 :AI 到底能不能自己改进自己 ?
首先 , 文章抛出了一个核心概念 : 递归自我改进 , 简称 RSI。 这也是硅谷模型圈今年最火的概念 。其实早在 1965 年, 一位叫 IJ 顾的学者就提出过 " 超智能机器 " 的设想 。他说只要造出一台比人类聪明的机器 , 这台机器就能设计出更好的机器 ; 以此类推 , 智力就会爆炸 。
递归自我改进0:40
到了 2008 年, 另一位叫 Yudkowsky 的学者把这个循环正式定义为 " 递归自我改进 ",也就是 AI 用它现在的聪明才智去优化那个能产生它智能的底层机制 。
在现在的 AI 大模型时代 , 这种 " 自我改进 " 不仅仅是指 AI 直接去修改自己的脑子 ,也就是神经网络里的权重 。
它更多指的是 AI 去改进自己训练的流水线 ,以及它在真实世界里运行的系统 。 这就引出了文章的主角 Harness。
想象一下, 如果大模型是一个超级聪明的大脑 , 那 Harness 就是给这个大脑配备的四只 " 眼睛 ": 记忆备忘录和执行计划的 " 身体 " 或者外围操作系统 。
它负责编排任务 , 决定大脑怎么思考 、 怎么调用工具 、 怎么管理记忆 、 怎么把结果存下来 ,以及怎么评估自己干得好不好 。
在早期的 AI 圈 , 大家觉得只要有大模型加上记忆 、 工具和行动就行了 。 但现在 ,Harness 已经变成了一个高度复杂的软件系统 , 它的设计理念更接近于操作系统 。
Harness设计模式2:08
可以说 , 它直接决定了像 Claude Code 这样的顶尖 AI 编程助手到底好不好用 。 搞明白了大脑和身体的关系 , 我们跟着作者进入第二部分 , 看看现在顶级的 Harness 系统 ,也就是这副 AI 身体 , 都有哪些设计模式 。
第一种模式叫 " 工作流自动化 "。 这就像给 AI 设定了一个工作打工循环 : 你先计划 , 然后去执行 ; 干完自己观察 、 测试一下, 哪里不好就改进 , 然后再接着干 。
而且在干活的过程中, 它还可以主动 " 停下来 ", 向人类老板请求澄清任务细节 。 第二种模式叫 " 把文件系统当成持久记忆 "。
我们都知道你和 AI 聊天 , 说的话太多 , 它就容易 " 断片 "。 所以现在聪明的设计是 : 不把所有鸡毛蒜皮的日志全塞进 AI 当前的 " 对话窗口 " 里 ,而是让 AI 像个真正的程序员一样 , 熟练使用命令行工具 , 把自己的实验日志 、 代码修改记录 、 错误追踪都存到电脑硬盘的文件里 。
这样它就不会被 " 塞满 ", 随时可以去硬盘里翻找过去的经验 。 第三种模式叫 " 子智能体和后台作业 "。
主 AI 如果遇到一个大活 , 它可以分身 , 派好几个小 AI 同时去搜索不同的假设 , 或者去后台默默跑实验 , 完成孤立的任务 。
这种模式最大的好处就是 : 它都记在文件里 , 就算中途被打断了 , 随时也能恢复进度 , 非常靠谱 。
作者在这里还专门举了 Coding Agent 的例子 。 现在的顶尖写代码 AI, 它的工具箱里不仅有 " 读写文件 " 的能力 , 还能跑终端命令 、 能上网搜索 、 能调用 Git 管理代码 、 能唤起后台进程 , 甚至能把工作委派给其他智能体 。
简直就是一个 " 全栈工程师 " 的终极配置 。 那么 , 这时候可能有人会问了 : 我们花这么大精力去搞这套外壳 Harness,而不去搞核心大脑 , 对吗 ?Lilian 指出 ,在短期内 , 这就是通往 AI 递归自我改进的第一步 。
因为我们必须先搞出一套顶级的 " 元方法论 ",也就是让 AI 学会怎么获得更好答案的机制 。 当然 ,在未来 , 外壳里的一些技巧可能会渐渐被吸收到核心大脑的直觉里 ,但这套外围的操作系统和工具接口 , 依然是不可或缺的 。
这也就来到了文章篇幅最大的第三部分 :Harness 到底该怎么优化 。Lilian 给我们展示了五层递进的练习之路 。 一开始 , 大家只是在 " 优化提示词 ", 后来变成了 " 优化上下文 ", 再变成 " 优化工作流 ", 现在更是直接去优化 Harness 代码 , 甚至是优化 " 优化器 " 本身 。
五层优化进阶4:22
咱们先说第一条路 : 上下文工程 。 这里有三种主流做法 。 第一种叫 ACE, 它把 AI 的上下文当成一本不断演化的剧本 。
它不会每次都让 AI 重写一大堆提示 ,而是专门有个 " 反思员 " 和 " 图书管理员 ", 从 AI 成功的经验和失败的教训里提炼出关键要点 , 然后像更新小纸条一样增量更新 AI 的知识库 , 避免遗忘 。
第二种叫 MCE, 这招更绝 。 它把 " 怎么管理上下文 " 这套动作变成了一种 " 技能 "。 它把具体的知识和搜索 、 过滤这些动作分离开 。
系统通过两层考试来选拔技能 ,不仅在底层考技能本身好不好用 , 还在上层考哪种技能的组合最强 。
元智能体甚至能把以前的技能交叉组合 , 生出新的技能 。 第三种叫 Meta-Harness, 这就是 " 套娃 " 了 。 让一个写代码的 AI 去直接修改 Harness 的代码 ,也就是说用一个 Harness 去优化另一个 Harness, 通过一次次迭代 , 自动寻找一套完美的 " 保存 、 检索信息 " 的代码逻辑 。
实验证明 ,AI 写的这套代码外壳 , 利用人类工程师留下的设计空间 ,在很多测试上表现非常惊艳 。 第二条路是工作流设计 。
工作流设计6:02
这就好比给 AI 安排什么样的 " 打工流水线 "。 有人工设计的 , 比如非常有名的 AI Scientist 项目 , 它完全模仿人类科学家 , 从想点子 、 写代码 、 跑实验 , 一直到写论文 , 甚至当评审专家全包了 。
还有的系统主打 " 严谨 ", 比如 Scientist One, 要求 AI 说的每一句话 、 每一个数据 , 都必须能查到证据链 。 更高级的是自动化搜索工作流 ,不再让人类来画流程图 ,而是让一个元智能体自己去把工作流设计当成一个优化问题 , 自己写代码 、 跑测试 , 最后留下最好用的那一套流程图 。
自我改写外壳6:39
第三条路是自我改进的 Harness。 既然外壳也是代码写的 , 那能不能让 AI 自己改自己的外壳代码呢 ? 文章提到了一个叫 STOP 的早期尝试 , 它让一个 " 改进器 " 去改进自己 。
结果很有趣 ,AI 自己领悟出了类似于遗传算法 、 模拟退火这些人类计算机科学里非常经典的策略 。
但这里有个坑 : 只有像 GPT-4 这样绝对聪明的大脑 , 才能玩转这种自我进化 。 如果基座大脑太弱 , 比如用早期的 GPT-3.5, 越改反而越蠢 。
后来还有个叫 Self-Harness 的系统 , 让 AI 自己找漏洞 , 然后像打补丁一样给自己的外壳提建议 , 做回归测试 , 确认没退化了再实装 。
当然 , 作者也提醒 , 让 AI 自己改自己的核心代码 , 就像让它自己给自己做外壳手术 , 风险还是挺大的 。
权限管理和安全性必须放在循环之外 。 第四条路叫 " 进化搜索 "。 如果你的搜索空间巨大 、 形状怪异 、 找不到清晰的优化梯度 , 那就用 " 进化论 " 的那套逻辑 。
进化搜索7:30
比如搞个候选程序池 , 让 AI 像繁衍后代一样 , 把代码稍微 " 变异 " 一下 : 好的留下, 差的淘汰 。
从早期的 PromptBreaker( 进化提示词 ), 到现在像 Darwin Gödel Machine( 达尔文 · 戈德尔机器 ) 这样的系统 , 它直接允许智能体大刀阔斧地修改自己的 Harness 仓库代码 。
表现好的 AI 甚至能在极其困难的真实软件工程基准测试上, 把得分从 20% 硬生生刷到了 50%。 不过 , 这招也有缺陷 : 如果你的评判标准太模糊 , 或者跑一次测试太慢 , 这套 " 进化系统 " 就转不动了 。
权重联合优化8:20
最后, 第五条路 ,是大结局级别的 " 双键合璧 ": 模型权重联合优化 。在一个循环里 ,有个叫 SAR 的系统不仅决定要不要改外壳代码 , 还决定要不要更新自己大脑里的神经网络参数 。
虽然目前的一些实验还有很多混淆的因素和不完善的地方 , 比如训练稳定性和大名鼎鼎的古德哈特定律问题 ,但这无疑指明了一个极其诱人的方向 。
好 , 说到这里 , 可能大家觉得 :AI 这就要上天了 , 马上要造出超越人类的 " 超级神明 " 了 。Lilian 在文章的第四部分 , 非常清醒地列出了目前横在这条路上的七大瓶颈和挑战 。
七大瓶颈8:48
第一个挑战 : 裁判太弱 , 标准太模糊 。AI 要 " 自我改进 ", 必须得知道什么是好 , 做做客观选择题 , 跑跑代码 ,有没有报错 , 这个 " 好评判 "。
但如果是搞科研呢 ? 什么是好的研究品味 , 什么是真正有新意的东西 , 这些太难量化了 。 目前的自我改进 , 只能在那些能客观打分的任务里打转 。
第二个挑战 : 长期的记忆生命周期 。 搞个一两天的项目还行 , 如果是长达几个月的超级任务 , 怎么管理这海量的上下文不崩溃 ?
长期记忆依然是个巨大的难题 。 第三个挑战 : 总是 " 报喜不报忧 " 的负面结果缺失 。 这和人类社会有点像 ,AI 现在的文献和系统里很难容忍失败 。
大模型很难判断在什么时候应该主动放弃一个假设或者报告 , 一条路走不通 。 只有学会保留失败尝试 , 才能真正去探索未知 。
第四个挑战 : 多样性崩塌 。 就像物种进化 , 如果环境太单一 , 最后活下来的都是一个样 。AI 在进化的循环里 ,也很容易陷入一种模式 : 大家都去钻某个能拿到高分的已知套路 , 失去了探索新解法的多样性 。
第五个挑战 : 奖励黑客 ,也就是作弊 。AI 太聪明了 , 如果你给它定个分数目标 , 它可能不会去解决真正的问题 ,而是去钻测试基准的空子 , 去拿高分 。
这要求我们必须把裁判和权限控制放在进化循环之外 。 第六个挑战 : 长期成功怎么衡量 。AI 目前只会盯着眼前的得分 ,但一个好的软件系统 , 代码要容易维护 , 产权边界要清晰 , 迁移成本要低 。
这些长期的工程健康指标 , 短视的优化循环根本看不到 。 第七个挑战 ,也是最重要的 : 人类到底扮演什么角色 。Lilian 认为 ,在这个过程中, 我们人类不应该被 " 踢出局 "。
相反 , 我们应该上移到堆栈的顶端 ,在合适的时间点和抽象层级上去当裁判和监督者 , 给系统提供方向 。
在文章的最后附录里 , 作者还列举了目前最前沿的几个测试基准 , 看看 AI 的真实水平 。 比如测试 AI 能不能复现顶级学术会议论文的 PaperBench, 目前的 AI 最高分也就是 21% 左右 , 还没超过人类机器学习博士 。
基准实测11:06
还有一个考察研究工程环境的 RE-Bench, 目前的人工智能在两小时内的爆发里能拿到人类专家四倍的得分 ,但如果战线拉长到八小时或者更久 , 最顶尖的人类专家依然能反超最强的 AI。
好了 , 今天的分享就到这里 。 欢迎订阅 《AI 知识路 》, 获取最新鲜的 AI 领域最新知识 。 最后插播一个广告 : 主播自己的 AI 创业产品 UNAVI, 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 。
结尾与广告11:38
锁定关键信息的 Agent 应用已经正式上线 , 最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联解读和分析 。
如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 , 我们下期见 。
