开场:模型自进化0:00
今天想跟大家聊一个最近在硅谷前沿实验室里特别火 、 几乎所有人都在讨论的话题 : 模型的 " 自我进化 ", 英文叫 RSI,Recursive Self-Improvement, 递归自进化 。
同类的词还包括 AutoResearch、AI for AI、 持续学习等等。 今天这期内容 , 来自主播近期对 RSI 相关的新闻 、 论文 、 播客的整体梳理综述 。
听完你会发现 , 模型的自我进化根本不是什么凭空冒出来的黑科技 ,而是过去几年大模型的几个底层能力 , 默默叠加到一定程度之后, 自然而然产生的一个必然结果 。
我们要讲的内容主要分两大部分 : 第一部分是支撑大模型演进的四个基础底座 ; 第二部分是在这四个底座之上长出来的四个自进化的核心概念 。
第一部分 : 大模型演进的四个基础底座 。 要理解自进化 , 我们得先看看托起整个大模型体系的四根大柱子 。
预训练与架构0:57
第一根柱子是预训练和模型架构 ,也就是大模型的 " 大脑地基 "。 预训练在模型架构上的演进主要来自开源模型 : 第一个是超大参数与极致稀疏的 MoE( 混合专家模型 )。
现在最顶尖的大模型 , 总参数量可能已经奔着 10 万亿 (10T) 去了 , 稍微低一档的也有 3 万亿 ; 像大家熟悉的 DeepSeek V4 Pro 也有 1.6 万亿 。
但这里有个 tricky 的点在于 : 模型虽然大 , 可每次回答你的问题时 ,并不需要所有大脑神经元一起 " 动 "。
这就好比一所超级大学里有 1000 名教授 ,但你问一个物理问题 , 学校只会挑最懂物理的 30 到 50 名教授来开会 , 激活比例只有 3% 到 5%。
这样既拥有超级庞大的知识库 , 推理起来又非常省计算资源 。 第二个是混合注意力机制 。 以前大模型读长文章 , 计算量是成平方级暴涨的 , 文章越长越读不起 。
现在的做法变聪明了 : 不管是 DeepSeek 的混合稀疏注意力 , 还是 Kimi 的混合线性注意力 , 都是为了让模型在读几十万 、 几百万字的长文本时, 既能抓住重点 、 不忘事 , 计算成本还大幅下降 。
第三个是优化器与残差连接的底层优化 。 比如 DeepSeek 和 Kimi 报告里都提到的 Muon 优化器 , 还有 MHC 和残差注意力 , 这样不断改进的残差连接结构 。
大家可别小看这些底层的数学和工程优化 , 它能让同样的显卡在同等时间内 " 多学 " 好几倍的东西 。
在这类精细化工程上, 国内的开源团队因为算力相对紧张 , 反而被逼出了极强的优化能力 , 甚至在某些点上走在了海外大厂前面 。
第二根柱子是后训练和强化学习 (RL), 也就是给聪明的大脑做 " 专业特训 "。 大模型光有通识知识还不够 ,以后训练主要做三件事 : 一 , 造数据 : 以前靠人类标注员一条条打分 , 后来发展成采集人类专家的真实解题轨迹 ; 到现在 , 最前沿的方式是让 AI 自己生成解题步骤 , 人类研究员和专家只制定规则和考核标准 ,也就是所谓的合成数据 ;
后训练与强化学习2:45
二 , 造环境 : 给 AI 搭建一个真实的 " 干活沙盒 ", 比如一个能真正运行代码的编程环境 , 或者一个模拟的企业办公软件环境 , 让 AI 在里面反复折腾 ; 三 , 定考核标准 (Bench): 给 AI 设目标 , 做对了给奖励 , 做错了扣分 , 甚至可以把不同专业方向分开做强化学习后训练 , 最后再融合成一个模型 。
这项技术最早是把 AI 写代码的能力带飞了 , 现在正在迅速向科学研究和专家工作扩展 , 更重要的是 , 让 AI 真正学会了怎么像人一样熟练使用各种工具 。
第三根柱子是推理 Infra,也就是让模型在显卡上跑得飞快 、 跑得极便宜的工程基建 : 模型训出来了 , 怎么让它以极低的成本 、 极快的速度 " 吐字 " 出来 。
推理基建3:54
这里面涉及自研推理引擎 、 投机解码 , 就是让小模型先猜几个词 , 大模型来把关 ; 大大加快速度 、 参数量化压缩 ,以及最底层的 GPU 算子优化 。
比如梁文锋最近谈话提到的 Tail lang, 就是寄希望于开源 DSL 对英伟达 CUDA 的逐步替代 。 可以说 , 今天最顶尖的 " 模型研究员 " 必须是一个极其精通底层硬件和工程架构的专家 。
第四根柱子是 Harness,也就是驾驭模型的 " 软件工程脚手架 "。 大家平时听到的系统提示词 、 工具定义 、Skill、 长期记忆 、 以及子 Agent 协同 , 都属于 Harness 的范畴 。
Harness 脚手架4:33
最精妙的地方在于 : 现在 Harness 开始和模型训练 " 打配合 " 了 。 比如有人提出 : 能不能在训练模型时, 就让它清楚地知道自己的记忆容量什么时候快满了 , 从而主动采取更聪明的信息压缩策略 ; 再比如 , 如果工具和操作环境是在模型训练阶段就内生融入进去的 , 模型用起这些工具来 , 就会比单纯靠临时理解指令要熟练得多 。
第二部分 : 四个核心概念 。AutoResearch、RSI、AI for AI、TTT。 有了上面这四个底座 , 我们就能看懂硅谷最近热议的三个关键概念了 。其实从本质上讲 ,AutoResearch、RSI 和 AI for AI 都是一回事 : 给模型一个工作环境和一个清晰的目标 , 看它能不能自己持续操作 , 根据结果反馈去纠正之前的做法 , 最终打破天花板 。
AutoResearch5:17
唯一的区别在于 , 它们各自侧重的环节不同 。 第一个概念 :AutoResearch( 自动研究 )。 这是最先落地的一层 , 意思是用已经很强的 AI 去自动完成某项具体的研究任务 。
比如田元栋老师的初创公司 Recursive 就做过让 AI 去自动优化底层的 GPU 运算代码 :AI 自己写代码 , 扔进真实环境里跑一下, 看运行速度有没有变快 ; 拿到反馈后发现不行就修改 ; 改完了再跑 , 一直循环 , 直到找到最佳方案 。
前不久 ,Recursive 团队在英伟达刚推出的算子优化竞赛上拿了第一名 , 比第二名的老牌专业团队高出整整 10%。
更有意思的是 ,Recursive 团队里根本没有 GPU 底层专家 ,他们就是靠这套 AI 自动研究的循环跑赢的 。 甚至 Kimi K3 在技术报告里也透露 ,他们用 K3 的早期版本就已经能帮自己做算子优化了 。
这说明什么 ?AI 帮自己做研究 , 已经不是 " 预言 ",而是 " 正在发生的事实 "。 第二个概念 :RSI( 递归自我改进 ), 也就是真正的模型自进化 。
这是大家追求的最终目标 : 模型自己研究自己 , 自己修改自己 , 让自己变得越来越强 。 这里要划一个重点 :RSI 跟我们常说的 " 模型蒸馏 " 有本质区别 。
RSI 递归自改进6:51
蒸馏就像小学生抄大学霸的作业 ,不管抄得多好 , 小学生的水平永远不可能超过 " 大学霸 "。 但 RSI 是 AI 自己去当研究员 , 发现自身的缺陷 , 做实验 , 改自己的模型架构和代码 ; 改完之后, 自己变强了 , 就能去发现更深层次的问题 , 从而形成一个螺旋上升的闭环 。
为什么这件事直到今年才被大家严肃讨论 ? 核心有两点 : 第一 ,AI 写代码的能力跨过了质变门槛 ; 第二 ,AI 对 " 什么是好的 AI" 开始具备了判断力 。
它不仅能当苦力 , 还能当 " 半个研究员 " 了 。 以前科研的周期是以天 、 甚至以月为单位的 , 导师给个思路 , 研究生花几个星期写代码做实验 , 最后看结果 ; 而现在 ,AI 把这个 " 尝试 、 反馈 、 修正 " 的循环压缩到了几分钟之内 。
田元栋老师做过一个对比 : 十年前大家也搞过自动机器学习 (AutoML), 但那时候的 AI 没有任何高层次的逻辑理解 , 只能在人类划定的极小格子里做穷举搜索 。
而今天的 LLM 懂逻辑 、 懂架构 , 它是在一个极其广阔的 " 解空间 " 里进行高质上的探索 。 当然 ,RSI 目前依然离不开人类顶级科学家的品味和直觉 ,因为大模型擅长的是在海量数据里找规律 ,但前沿科学最开创性的地方 , 往往是 " 全人类都还没产生过数据 " 的地方 。
在工业界 , 各家动作非常快 。OpenAI 明确提出 , 计划在 2026 年 9 月做出 AI 研究实习生 ,2028 年前实现完全自动化的 AI 研究员 。
前段时间 ,TML 的翁立也重返 OpenAI 铺在 RSI 上 。Anthropic 前不久刚公布 ,他们的 Agent 独立工作了 800 个小时, 自主完成了一项开放式的 AI 安全研究 。
AI for AI8:55
著名 Koel Karpathy 也加入了 Anthropic 参与这项探索 。 第三个概念 :AI for AI( 用 AI 来理解并提升 AI)。 这一派的理念更偏向于 " 先理解再提升 "。
现在很多做法是用 AI 当工具人 : 写论文 、 改脚本 , 属于用神经网络去改神经网络 , 缺乏严谨的物理和符号机理 。
而清华的刘子明为代表的研究院则提出要用 " 物理学的方法 " 去解剖 AI 的内部运转机制 。他认为人类所谓的 " 科研直觉 ", 本质上是人脑还没来得及用语言解释清楚的高速思考链 。
只要把这种思考过程结构化地记录下来 , 就能像训大模型一样 , 去训练一个 " 懂科研逻辑 " 的模型 。
田元栋老师也认为 , 大模型的 " 可解释性 " 是接下来最关键的方向之一 。 如果未来 AI 能在某个领域提出一套完全碾压现有 Transformer 的全新架构 ,并且在数学和逻辑上能让人类信服 , 那将是 AI for AI 真正的 " 里程碑时刻 "。
讲到这里 , 大家就能把整张图串起来了 : 预训练给 AI 知识底蕴 , 后训练给它长步骤执行和工具能力 , 推理 Infra 带来极致的速度和低成本 ,Harness 赋予它长程记忆与回溯能力 。
当这四个底座全部就位 ,AutoResearch、RSI 和 AI for AI 的爆发就是顺理成章的 。 在聊完上面这些之后, 最后我们必须提一个极具冲击力的新流派 , 那就是 OpenAI 前首席科学家 Ilya Sutskever 创办的 SSI Safe Superintelligence。
最近关于 SSI 有个重磅爆料 : 他们正在打造一个以 TTT(Test Time Training( 测试时训练 )) 为核心的全新推理引擎 。
TTT 测试时训练10:33
这套范式到底颠覆了什么 ? 大家知道 , 目前我们用的所有大模型 , 参数权重都是静态的 , 模型在机房里训练好之后就被 " 打包封箱 " 了 。
当你跟它对话时, 它的内部参数是固定不变的 。 这就会带来一个巨大痛点 : 大模型面对没见过的全新问题时, 很容易一本正经地胡说八道 。
而且作为数字助手 , 它每天早上醒来都像个失忆症患者 , 全靠外部外挂知识库 (RAG) 像翻病历一样临时去查 , 响应慢且不够连贯 。
而 SSI 探索的 TTT 范式 , 核心理念就是 : 允许模型直接在推理阶段 、 在跟你实时互动的过程中, 动态修改自己的模型参数 。
打个比方 ,以前的模型就像一个考前死记硬背了整座图书馆的学生 : 上了考场脑子就被冻结了 , 只能凭死记的内容答题 。
而 TTT 范式下的模型 ,是 : 在考场答题的这一秒 , 大脑里的神经突触还在根据当下的具体题目和新信息 , 实时重组和进化 。
这带来了几个可怕的优势 : 第一 , 极致的数据效率 。 模型不需要在出场前硬吞全人类所有的废话 , 它只需要把 " 如何学习 " 这套元能力练到极致 。
一个小参数量的模型 , 通过在推理时动态调整权重 , 可能就能正面硬刚几万张显卡硬训出来的巨无霸 。
第二 , 真正的长期记忆沉淀 。 它在跟你协作 、 解决复杂问题时产生的快速权重 , 能够安全地沉淀为专属于你的物理突触 。
它不再是一个每天格式化重启的冰冷软件 ,而是真正把你的业务经验刻进了它的大脑里 。 第三 , 打开了算力 (Scaling)的新维度 。
过去大家拼的是谁离线训练得集群大 , 现在拼的是谁能在实时解决问题时, 投入更多算力去深度思考和实时学习 。
这也解释了为什么英伟达近期给 SSI 投了重资 ,并提供了下一代顶级算力支持 。 从底座的极限打磨 , 到 RSI 的自进化闭环 , 再到 TTT 这种直接在推理时重塑自我的全新范式 , 大模型正在从一个静态工具 , 真正大步迈向能够持续学习 、 具备独立思考与自我进化能力的 " 智能新智 "。
这就是本期节目的全部内容 , 希望对你理解大模型的最前沿演进有所启发 。 我们下期见 。 这就是今天跟大家分享的全部内容 , 欢迎订阅 《AI 智识录 》, 获取最新鲜的 AI 领域最新智识 。
最后插播一个广告 : 主播自己的 AI 创业产品 "YouNavi", 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 / 录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 。
总结与广告13:16
锁定关键信息的 Agent 应用已经正式上线 , 最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联解读和分析 。
如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 , 我们下期见 。
