# RSI、AI for AI、AutoResearch 这些概念都在说什么

AI智识录 · 2026-08-17

<https://ai.podhood.com/333aa075-44ed-473d-b401-da492d787fba>

本期节目系统综述模型的“自我进化”（RSI，递归自改进）及同类概念AutoResearch、AI for AI与持续学习，核心主张是：模型自我进化并非凭空的黑科技，而是预训练与架构、后训练与强化学习、推理Infra、Harness四大底层能力叠加到一定程度后的必然结果。节目指出顶级模型总参数已奔向10万亿（如DeepSeek V4 Pro达1.6万亿），但MoE每次推理仅激活3%–5%的参数，如同万人大校只叫最对口的几十位教授，配合混合注意力机制与Muon优化器实现“又大又省”。在落地实例上，田元栋的初创公司Recursive靠AI自动优化GPU算子、在英伟达算子优化竞赛中夺冠并高出第二名专业团队整整10%，Kimi K3也在用早期版本帮自己做算子优化；RSI与“蒸馏”有本质区别——蒸馏像小学生抄大学霸作业永远无法超越，RSI则是模型自己研究自己、形成螺旋上升的闭环。OpenAI计划2026年9月做出AI研究实习生、2028年前实现完全自动化的AI研究员，Anthropic的Agent已独立工作800小时完成开放式AI安全研究，Karpathy也加入了Anthropic。最后节目介绍Ilya Sutskever创办的SSI正打造的TTT（测试时训练）新范式：允许模型在推理阶段实时修改自身参数，可能颠覆现有静态权重范式，带来极致数据效率、真正的长期记忆沉淀与算力Scaling的新维度。

## Questions this episode answers

### RSI 和模型蒸馏有什么本质区别？

主播李广密解释：蒸馏像小学生抄大学霸的作业，抄得再好水平也不会超过被抄者；而 RSI 是 AI 自己当研究员，发现自身缺陷、做实验、修改自己的模型架构和代码，变强后又能发现更深层次的问题，形成螺旋上升的闭环。

[6:51](https://ai.podhood.com/333aa075-44ed-473d-b401-da492d787fba?t=411000)

### SSI 正在探索的 TTT（测试时训练）范式颠覆了什么？

Ilya Sutskever 创办的 SSI 正打造以 TTT 为核心的推理引擎，允许模型在推理阶段实时修改自身参数。优势包括极致数据效率、快速权重可沉淀为专属物理突触形成真正长期记忆，并打开算力 Scaling 的新维度，英伟达也因此重资投资。

[10:33](https://ai.podhood.com/333aa075-44ed-473d-b401-da492d787fba?t=633000)

### AutoResearch 已经有哪些真实落地的成果？

田元栋的初创公司 Recursive 让 AI 自动优化 GPU 运算代码，在英伟达算子优化竞赛上拿第一名，比第二名老牌专业团队高出整整 10%，团队里甚至没有 GPU 底层专家；Kimi K3 技术报告也透露用早期版本帮自己做算子优化。

[5:58](https://ai.podhood.com/333aa075-44ed-473d-b401-da492d787fba?t=358000)

### 大模型演进的四个基础底座是什么？

主播李广密梳理为四根柱子：一是预训练与模型架构，如超大参数稀疏 MoE、混合注意力机制和 Muon 优化器；二是后训练与强化学习，通过合成数据、沙盒环境和考核标准；三是推理 Infra，含投机解码与 GPU 算子优化；四是 Harness 软件脚手架。

[0:49](https://ai.podhood.com/333aa075-44ed-473d-b401-da492d787fba?t=49000)

## Key moments

- **[0:00] 开场：模型自进化**
- **[0:49] 四大基础底座**
- **[0:57] 预训练与架构**
  - [0:57] 占位
  - [1:12] 顶尖大模型总参数已奔10万亿，MoE每次推理只激活3%–5%参数，如同千名教授只叫最懂物理的30–50位
  - [2:34] 混合注意力机制让模型读几十万字长文本时抓住重点、不忘事，计算成本大幅下降
- **[2:45] 后训练与强化学习**
- **[3:54] 推理基建**
  - [4:05] 国内开源团队因算力紧张被逼出极强优化能力，某些点上走在海外大厂前面
- **[4:33] Harness 脚手架**
  - [4:54] 后训练三件事：合成数据、真实沙盒环境、Bench考核标准，让AI学会像人一样使用工具
- **[5:17] AutoResearch**
  - [5:54] 梁文锋谈到的Tail lang开源DSL，寄望逐步替代英伟达CUDA
- **[6:51] RSI 递归自改进**
- **[8:55] AI for AI**
  - [9:04] Recursive靠AI自动优化GPU算子拿下英伟达竞赛第一，比第二名专业团队高出10%，团队里根本没有GPU专家
- **[10:33] TTT 测试时训练**
  - [10:51] RSI与蒸馏的本质区别：蒸馏是小学生抄大学霸作业永远超不过，RSI是AI自己当研究员形成螺旋上升闭环
  - [12:05] AI把科研的尝试、反馈、修正循环从以月为单位压缩到几分钟之内
- **[13:16] 总结与广告**
  - [13:29] OpenAI计划2026年9月做出AI研究实习生，2028年前实现完全自动化的AI研究员

## Topics

自动化AI研究

## Mentioned

Anthropic (company), DeepSeek (company), NVIDIA (company), OpenAI (company), Recursive (company), SSI (company), Kimi K3 (product)

## Transcript

### 开场：模型自进化

**Host** [0:00]
今天想跟大家聊一个最近在硅谷前沿实验室里特别火 、 几乎所有人都在讨论的话题 ： 模型的 " 自我进化 "， 英文叫 RSI，Recursive Self-Improvement， 递归自进化 。

同类的词还包括 AutoResearch、AI for AI、 持续学习等等。 今天这期内容 ， 来自主播近期对 RSI 相关的新闻 、 论文 、 播客的整体梳理综述 。

听完你会发现 ， 模型的自我进化根本不是什么凭空冒出来的黑科技 ，而是过去几年大模型的几个底层能力 ， 默默叠加到一定程度之后， 自然而然产生的一个必然结果 。

我们要讲的内容主要分两大部分 ： 第一部分是支撑大模型演进的四个基础底座 ； 第二部分是在这四个底座之上长出来的四个自进化的核心概念 。

第一部分 ： 大模型演进的四个基础底座 。 要理解自进化 ， 我们得先看看托起整个大模型体系的四根大柱子 。

### 预训练与架构

**Host** [0:57]
第一根柱子是预训练和模型架构 ，也就是大模型的 " 大脑地基 "。 预训练在模型架构上的演进主要来自开源模型 ： 第一个是超大参数与极致稀疏的 MoE（ 混合专家模型 ）。

现在最顶尖的大模型 ， 总参数量可能已经奔着 10 万亿 （10T） 去了 ， 稍微低一档的也有 3 万亿 ； 像大家熟悉的 DeepSeek V4 Pro 也有 1.6 万亿 。

但这里有个 tricky 的点在于 ： 模型虽然大 ， 可每次回答你的问题时 ，并不需要所有大脑神经元一起 " 动 "。

这就好比一所超级大学里有 1000 名教授 ，但你问一个物理问题 ， 学校只会挑最懂物理的 30 到 50 名教授来开会 ， 激活比例只有 3% 到 5%。

这样既拥有超级庞大的知识库 ， 推理起来又非常省计算资源 。 第二个是混合注意力机制 。 以前大模型读长文章 ， 计算量是成平方级暴涨的 ， 文章越长越读不起 。

现在的做法变聪明了 ： 不管是 DeepSeek 的混合稀疏注意力 ， 还是 Kimi 的混合线性注意力 ， 都是为了让模型在读几十万 、 几百万字的长文本时， 既能抓住重点 、 不忘事 ， 计算成本还大幅下降 。

第三个是优化器与残差连接的底层优化 。 比如 DeepSeek 和 Kimi 报告里都提到的 Muon 优化器 ， 还有 MHC 和残差注意力 ， 这样不断改进的残差连接结构 。

大家可别小看这些底层的数学和工程优化 ， 它能让同样的显卡在同等时间内 " 多学 " 好几倍的东西 。

在这类精细化工程上， 国内的开源团队因为算力相对紧张 ， 反而被逼出了极强的优化能力 ， 甚至在某些点上走在了海外大厂前面 。

第二根柱子是后训练和强化学习 （RL）， 也就是给聪明的大脑做 " 专业特训 "。 大模型光有通识知识还不够 ，以后训练主要做三件事 ： 一 ， 造数据 ： 以前靠人类标注员一条条打分 ， 后来发展成采集人类专家的真实解题轨迹 ； 到现在 ， 最前沿的方式是让 AI 自己生成解题步骤 ， 人类研究员和专家只制定规则和考核标准 ，也就是所谓的合成数据 ；

### 后训练与强化学习

**Host** [3:15]
二 ， 造环境 ： 给 AI 搭建一个真实的 " 干活沙盒 "， 比如一个能真正运行代码的编程环境 ， 或者一个模拟的企业办公软件环境 ， 让 AI 在里面反复折腾 ； 三 ， 定考核标准 （Bench）： 给 AI 设目标 ， 做对了给奖励 ， 做错了扣分 ， 甚至可以把不同专业方向分开做强化学习后训练 ， 最后再融合成一个模型 。

这项技术最早是把 AI 写代码的能力带飞了 ， 现在正在迅速向科学研究和专家工作扩展 ， 更重要的是 ， 让 AI 真正学会了怎么像人一样熟练使用各种工具 。

第三根柱子是推理 Infra，也就是让模型在显卡上跑得飞快 、 跑得极便宜的工程基建 ： 模型训出来了 ， 怎么让它以极低的成本 、 极快的速度 " 吐字 " 出来 。

### 推理基建

**Host** [4:05]
这里面涉及自研推理引擎 、 投机解码 ， 就是让小模型先猜几个词 ， 大模型来把关 ； 大大加快速度 、 参数量化压缩 ，以及最底层的 GPU 算子优化 。

比如梁文锋最近谈话提到的 Tail lang， 就是寄希望于开源 DSL 对英伟达 CUDA 的逐步替代 。 可以说 ， 今天最顶尖的 " 模型研究员 " 必须是一个极其精通底层硬件和工程架构的专家 。

第四根柱子是 Harness，也就是驾驭模型的 " 软件工程脚手架 "。 大家平时听到的系统提示词 、 工具定义 、Skill、 长期记忆 、 以及子 Agent 协同 ， 都属于 Harness 的范畴 。

### Harness 脚手架

**Host** [4:48]
最精妙的地方在于 ： 现在 Harness 开始和模型训练 " 打配合 " 了 。 比如有人提出 ： 能不能在训练模型时， 就让它清楚地知道自己的记忆容量什么时候快满了 ， 从而主动采取更聪明的信息压缩策略 ； 再比如 ， 如果工具和操作环境是在模型训练阶段就内生融入进去的 ， 模型用起这些工具来 ， 就会比单纯靠临时理解指令要熟练得多 。

第二部分 ： 四个核心概念 。AutoResearch、RSI、AI for AI、TTT。 有了上面这四个底座 ， 我们就能看懂硅谷最近热议的三个关键概念了 。其实从本质上讲 ，AutoResearch、RSI 和 AI for AI 都是一回事 ： 给模型一个工作环境和一个清晰的目标 ， 看它能不能自己持续操作 ， 根据结果反馈去纠正之前的做法 ， 最终打破天花板 。

### AutoResearch

**Host** [5:44]
唯一的区别在于 ， 它们各自侧重的环节不同 。 第一个概念 ：AutoResearch（ 自动研究 ）。 这是最先落地的一层 ， 意思是用已经很强的 AI 去自动完成某项具体的研究任务 。

比如田元栋老师的初创公司 Recursive 就做过让 AI 去自动优化底层的 GPU 运算代码 ：AI 自己写代码 ， 扔进真实环境里跑一下， 看运行速度有没有变快 ； 拿到反馈后发现不行就修改 ； 改完了再跑 ， 一直循环 ， 直到找到最佳方案 。

前不久 ，Recursive 团队在英伟达刚推出的算子优化竞赛上拿了第一名 ， 比第二名的老牌专业团队高出整整 10%。

更有意思的是 ，Recursive 团队里根本没有 GPU 底层专家 ，他们就是靠这套 AI 自动研究的循环跑赢的 。 甚至 Kimi K3 在技术报告里也透露 ，他们用 K3 的早期版本就已经能帮自己做算子优化了 。

这说明什么 ？AI 帮自己做研究 ， 已经不是 " 预言 "，而是 " 正在发生的事实 "。 第二个概念 ：RSI（ 递归自我改进 ）， 也就是真正的模型自进化 。

这是大家追求的最终目标 ： 模型自己研究自己 ， 自己修改自己 ， 让自己变得越来越强 。 这里要划一个重点 ：RSI 跟我们常说的 " 模型蒸馏 " 有本质区别 。

### RSI 递归自改进

**Host** [7:03]
蒸馏就像小学生抄大学霸的作业 ，不管抄得多好 ， 小学生的水平永远不可能超过 " 大学霸 "。 但 RSI 是 AI 自己去当研究员 ， 发现自身的缺陷 ， 做实验 ， 改自己的模型架构和代码 ； 改完之后， 自己变强了 ， 就能去发现更深层次的问题 ， 从而形成一个螺旋上升的闭环 。

为什么这件事直到今年才被大家严肃讨论 ？ 核心有两点 ： 第一 ，AI 写代码的能力跨过了质变门槛 ； 第二 ，AI 对 " 什么是好的 AI" 开始具备了判断力 。

它不仅能当苦力 ， 还能当 " 半个研究员 " 了 。 以前科研的周期是以天 、 甚至以月为单位的 ， 导师给个思路 ， 研究生花几个星期写代码做实验 ， 最后看结果 ； 而现在 ，AI 把这个 " 尝试 、 反馈 、 修正 " 的循环压缩到了几分钟之内 。

田元栋老师做过一个对比 ： 十年前大家也搞过自动机器学习 （AutoML）， 但那时候的 AI 没有任何高层次的逻辑理解 ， 只能在人类划定的极小格子里做穷举搜索 。

而今天的 LLM 懂逻辑 、 懂架构 ， 它是在一个极其广阔的 " 解空间 " 里进行高质上的探索 。 当然 ，RSI 目前依然离不开人类顶级科学家的品味和直觉 ，因为大模型擅长的是在海量数据里找规律 ，但前沿科学最开创性的地方 ， 往往是 " 全人类都还没产生过数据 " 的地方 。

在工业界 ， 各家动作非常快 。OpenAI 明确提出 ， 计划在 2026 年 9 月做出 AI 研究实习生 ，2028 年前实现完全自动化的 AI 研究员 。

前段时间 ，TML 的翁立也重返 OpenAI 铺在 RSI 上 。Anthropic 前不久刚公布 ，他们的 Agent 独立工作了 800 个小时， 自主完成了一项开放式的 AI 安全研究 。

### AI for AI

**Host** [8:55]
著名 Koel Karpathy 也加入了 Anthropic 参与这项探索 。 第三个概念 ：AI for AI（ 用 AI 来理解并提升 AI）。 这一派的理念更偏向于 " 先理解再提升 "。

现在很多做法是用 AI 当工具人 ： 写论文 、 改脚本 ， 属于用神经网络去改神经网络 ， 缺乏严谨的物理和符号机理 。

而清华的刘子明为代表的研究院则提出要用 " 物理学的方法 " 去解剖 AI 的内部运转机制 。他认为人类所谓的 " 科研直觉 "， 本质上是人脑还没来得及用语言解释清楚的高速思考链 。

只要把这种思考过程结构化地记录下来 ， 就能像训大模型一样 ， 去训练一个 " 懂科研逻辑 " 的模型 。

田元栋老师也认为 ， 大模型的 " 可解释性 " 是接下来最关键的方向之一 。 如果未来 AI 能在某个领域提出一套完全碾压现有 Transformer 的全新架构 ，并且在数学和逻辑上能让人类信服 ， 那将是 AI for AI 真正的 " 里程碑时刻 "。

讲到这里 ， 大家就能把整张图串起来了 ： 预训练给 AI 知识底蕴 ， 后训练给它长步骤执行和工具能力 ， 推理 Infra 带来极致的速度和低成本 ，Harness 赋予它长程记忆与回溯能力 。

当这四个底座全部就位 ，AutoResearch、RSI 和 AI for AI 的爆发就是顺理成章的 。 在聊完上面这些之后， 最后我们必须提一个极具冲击力的新流派 ， 那就是 OpenAI 前首席科学家 Ilya Sutskever 创办的 SSI Safe Superintelligence。

最近关于 SSI 有个重磅爆料 ： 他们正在打造一个以 TTT（Test Time Training（ 测试时训练 ）） 为核心的全新推理引擎 。

### TTT 测试时训练

**Host** [10:42]
这套范式到底颠覆了什么 ？ 大家知道 ， 目前我们用的所有大模型 ， 参数权重都是静态的 ， 模型在机房里训练好之后就被 " 打包封箱 " 了 。

当你跟它对话时， 它的内部参数是固定不变的 。 这就会带来一个巨大痛点 ： 大模型面对没见过的全新问题时， 很容易一本正经地胡说八道 。

而且作为数字助手 ， 它每天早上醒来都像个失忆症患者 ， 全靠外部外挂知识库 （RAG） 像翻病历一样临时去查 ， 响应慢且不够连贯 。

而 SSI 探索的 TTT 范式 ， 核心理念就是 ： 允许模型直接在推理阶段 、 在跟你实时互动的过程中， 动态修改自己的模型参数 。

打个比方 ，以前的模型就像一个考前死记硬背了整座图书馆的学生 ： 上了考场脑子就被冻结了 ， 只能凭死记的内容答题 。

而 TTT 范式下的模型 ，是 ： 在考场答题的这一秒 ， 大脑里的神经突触还在根据当下的具体题目和新信息 ， 实时重组和进化 。

这带来了几个可怕的优势 ： 第一 ， 极致的数据效率 。 模型不需要在出场前硬吞全人类所有的废话 ， 它只需要把 " 如何学习 " 这套元能力练到极致 。

一个小参数量的模型 ， 通过在推理时动态调整权重 ， 可能就能正面硬刚几万张显卡硬训出来的巨无霸 。

第二 ， 真正的长期记忆沉淀 。 它在跟你协作 、 解决复杂问题时产生的快速权重 ， 能够安全地沉淀为专属于你的物理突触 。

它不再是一个每天格式化重启的冰冷软件 ，而是真正把你的业务经验刻进了它的大脑里 。 第三 ， 打开了算力 （Scaling）的新维度 。

过去大家拼的是谁离线训练得集群大 ， 现在拼的是谁能在实时解决问题时， 投入更多算力去深度思考和实时学习 。

这也解释了为什么英伟达近期给 SSI 投了重资 ，并提供了下一代顶级算力支持 。 从底座的极限打磨 ， 到 RSI 的自进化闭环 ， 再到 TTT 这种直接在推理时重塑自我的全新范式 ， 大模型正在从一个静态工具 ， 真正大步迈向能够持续学习 、 具备独立思考与自我进化能力的 " 智能新智 "。

这就是本期节目的全部内容 ， 希望对你理解大模型的最前沿演进有所启发 。 我们下期见 。 这就是今天跟大家分享的全部内容 ， 欢迎订阅 《AI 智识录 》， 获取最新鲜的 AI 领域最新智识 。

最后插播一个广告 ： 主播自己的 AI 创业产品 "YouNavi"， 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 / 录音豆 ， 随时随地帮您解读日常会议与沟通背后的深意 。

### 总结与广告

**Host** [13:31]
锁定关键信息的 Agent 应用已经正式上线 ， 最新的版本也支持了直接给它播客链接 ， 它就能轻松完成转写 、 总结 、 分析 ， 甚至多个播客的关联解读和分析 。

如果你有兴趣 ， 欢迎在本播客的公告栏查看体验方式 ， 我们下期见 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
