翁荔:为模型自我改进而设计的Harness工程
2026年7月8日 · 12:16
本期解读前OpenAI安全系统副总裁、Thinking Machines Lab联合创始人翁荔(Lilian Weng)的长文《为自我改进而进行的Harness工程》,核心观点是:把大模型比作大脑,围绕它的Harness就是身体与操作系统,负责编排任务、管理记忆、调用工具和执行评估,其设计已成为决定智能体能力上限的关键工程变量。文章回顾了递归自我改进(RSI)从1965年IJ·古德'智力爆炸'设想到2008年Yudkowsky正式定义的脉络,并梳理工作流自动化、文件系统当持久记忆、子智能体与后台作业三大Harness设计模式。在优化路径上,翁荔划出五层递进:从优化提示词、上下文(如ACE、MCE),到工作流设计(AI Scientist)、让AI改写自身Harness代码(STOP、Self-Harness),再到Darwin Gödel Machine等进化搜索(真实软件工程基准从20%刷到50%)和模型权重联合优化。她同时指出七大瓶颈:主观任务难量化评估、长期记忆管理未解、负面结果缺失、多样性崩塌、奖励作弊、长期工程健康指标缺失,以及人类应上移到堆栈顶端担任裁判与监督者。附录以真实水位收尾:PaperBench上AI最高约21%仍未超越人类机器学习博士,RE-Bench中AI两小时爆发力达人类专家四倍,但拉长到八小时以上最顶尖人类仍能反超。