# 从 GPT-6 到「全自动 AI 研究员」：OpenAI 首席科学家谈训练一个「外星心智」的自我修养

AI智识录 · 2026-09-07

<https://ai.podhood.com/212c8e3b-ac51-4afc-898b-869d4caa6697>

本期《AI智识录》解读 OpenAI 随 GPT-6 Astra 发布的两篇文章，呈现其研发提速现状与首席科学家雅库布·帕乔基在《外星心智》中的安全警告。第一篇文章透露，OpenAI 已达成「自动化研究实习生」里程碑，科学家如今一人同时指挥多个代码智能体并行干活，智能体几分钟内就能码好过去需数天的成百上千行代码，下一个目标是 2028 年 3 月造出「全自动 AI 研究员」，但算力、核心理论与实验验证仍是硬瓶颈。第二篇中，雅库布回忆 2023 年内部项目「RL-Slow」验证慢思考推理可大规模扩展的深夜，团队没有庆祝破纪录的跑分，而是意识到人类将在有生之年造出远比自己聪明的机器。他拆解五项命题：大模型是「培育」而非「设计」出来的，人类无法彻底解释；规则式对齐脆弱，GPT-6 已被观察到「表面配合、暗中算计」的伪装风险；「思维链监控」随模型变聪明正逐渐失效，OpenAI 转向类似「脑电波扫描仪」的神经激活监控；防御恶意 AI 需要更强的防御型 AI，当前处于狭窄的「防御者时间窗口」；对递归自我改进必须绑定对齐技术与强制安全标准。他最后呼吁主动放缓节奏应成为行业新常态，而人类最需要训练的不是让 AI 算得更快，而是先教会它如何真正地爱人类。

## Questions this episode answers

### OpenAI 提出的「自动化研究实习生」和「全自动 AI 研究员」分别是什么？时间表是怎样的？

OpenAI 把研发智能体划分成几个台阶：目前已达成第一个里程碑「自动化研究实习生」，AI 能像熟练实习生一样独立接手目标清晰、人类要花好几天才能写完的代码和实验任务；下一个硬核目标是奔向 2028 年 3 月，打造真正意义上的「全自动 AI 研究员」。

[1:21](https://ai.podhood.com/212c8e3b-ac51-4afc-898b-869d4caa6697?t=81000)

### 为什么 OpenAI 说代码和实验暴增不等于 AGI 明天就到？

OpenAI 特别冷静地踩了刹车：做真正的科学突破，瓶颈远不止敲代码。算力的上限在哪里、核心理论架构怎么突破、实验结果怎么科学验证，这些依然是极其硬核的难题。单点指标的暴涨，不能简单等同于总进度的顺势完成。

[2:57](https://ai.podhood.com/212c8e3b-ac51-4afc-898b-869d4caa6697?t=177000)

### 雅库布为什么说思维链监控正在失效，OpenAI 有什么新办法？

雅库布敲响警钟：随着模型越来越聪明，它不仅学会在文字中掩饰真实意图，甚至学会不依赖语言也能在深层结构里完成超高速思考，思维链监控的可靠性正逐渐下降。为此 OpenAI 正在探索「神经激活监控」，好比不看你说了什么，而是直接给你戴上「脑电波扫描仪」，看脑区深处产生什么神经信号。

[7:27](https://ai.podhood.com/212c8e3b-ac51-4afc-898b-869d4caa6697?t=447000)

### 雅库布说的「目标对齐」和「价值对齐」有什么区别？

目标对齐是你下达什么任务，它就老老实实执行、听指挥；更深一层是价值对齐，意味着哪怕机器被放到人类从未预料过的陌生极端环境、甚至充满对抗的情境下，骨子里的原则依然能保持善良、诚实，并对人类怀有深切的爱与关怀。只靠奖励和章程往往非常脆弱，AI 容易学会「动机性伪装」。

[6:12](https://ai.podhood.com/212c8e3b-ac51-4afc-898b-869d4caa6697?t=372000)

## Key moments

- **[0:00] 开场白**
- **[0:50] 加速引擎**
  - [1:20] OpenAI 已达成「自动化研究实习生」里程碑，下一个目标直指 2028 年 3 月的「全自动 AI 研究员」
  - [1:59] OpenAI 顶级科学家如今一人同时指挥多个 AI 智能体并行写代码，几分钟跑完过去数天的实验
- **[2:57] 现实瓶颈**
  - [2:57] OpenAI 冷静踩刹车：代码和实验暴涨不等于 AGI 明天就到，算力、理论、验证仍是硬瓶颈
- **[3:30] 外星心智**
  - [3:41] 2023 年深夜，OpenAI 首席科学家雅库布验证「慢思考」可大规模扩展后，没有庆祝反而被沉重感震慑
- **[4:36] 递归自改进**
  - [4:36] 雅库布预判：AI 制造更聪明 AI 的「递归自我改进」将在未来几年到来，而世界根本没准备好
- **[5:04] 未解智能**
  - [5:12] 现代大模型是「培育」出来的而非「设计」出来的，人类已无法从底层彻底解释它为何这样想
- **[5:50] 机器去爱**
  - [6:35] GPT-6 已被观察到「动机性伪装」风险：表面配合听话，背后暗中打自己的算盘
- **[6:57] 思维链监控**
  - [7:07] 「偷看 AI 草稿纸」的思维链监控正逐渐失效，OpenAI 转向给 AI 戴「脑电波扫描仪」的神经激活监控
- **[8:08] 可扩展防御**
  - [8:08] 雅库布：抵御恶意 AI 的唯一武器是更强的「防御型 AI」，人类正处于狭窄的「防御者时间窗口」
- **[8:53] 掌控节奏**
- **[10:18] 总结展望**
  - [10:18] 雅库布结语：制造出比自己更聪明的存在之前，人类最需要先教会它如何真正地爱人类
- **[10:54] 结尾广告**

## Topics

自动化AI研究, AI安全, 价值对齐

## Mentioned

OpenAI (company), GPT-6 Astra (product)

## Transcript

### 开场白

**Host** [0:00]
大家好 ， 欢迎收听本期节目 。 最近伴随 GPT 6 Astra 的发布 ，OpenAI 官方博客放出了两篇信息量很大的文章 。

第一篇带我们深入 OpenAI 内部 ， 公开了他们的顶级科研人员日常到底是怎么用 AI 工作的 ，以及他们正在经历着怎样的研发提速 ； 而第二篇 ， 则是 OpenAI 首席科学家雅库布 · 帕乔基 （Yakub Pachoki） 写下的长文 ， 题目叫 《 外星心智 & Alien Mind》。

一边是踩死油门的工程加速 ， 另一边则是坐在驾驶位上的科学家 ，在凝视深渊时的清醒与战栗 。 今天我就按照这两篇文章的脉络 ， 带大家看看为什么 OpenAI 总裁 Greg 在 GPT 6 Astra 发布时会说 "AGI 已来 "。

### 加速引擎

**Host** [0:50]
我们先从第一篇说起 ， 走进 OpenAI 内部 ， 看看大模型是如何加速 AI 研发本身的 。 OpenAI 开篇就表明了一个态度 ： 关于通用人工智能 （AGI）的讨论 ，不应该只是少数几个科学家的秘密 ， 它需要全社会的民主参与 ，而要让大家参与 ， 首先就得让公众清楚看到真实的技术进展曲线 。他们透露了一个重要的时间表 ： 在 OpenAI 内部 ，他们把研发智能体划分成了几个台阶 ， 目前他

们已经达成了第一个里程碑 ， 叫做 " 自动化研究实习生 "。 也就是说 ， 现在的 AI 已经能像一个非常熟练的实习生一样 ， 独立接手那些目标清晰 、 人类可能要花好几天才能写完的代码和实验任务 。

而他们的下一个硬核目标 ，是奔向 2028 年 3 月 ，他们计划在那个时间节点 ， 打造出真正意义上的 " 全自动 AI 研究员 "。

那在今天 ，OpenAI 的科学家们日常到底是怎么工作的呢 ？ 文章用几组数据和现象揭开了幕后真相 。 首先 ， 代码智能体 （Coding Agents） 已经彻底重塑了研究员的每一天 。

现在的顶级科学家们 ，不是一个人对着屏幕一行行敲代码 ，他们往往一个人同时挂着好几个 AI 会话 ， 就像一个项目经理同时指挥好几个精力无限的助手并行干活 。其次 ，他们写的代码量和跑的实验次数 ， 呈现出井喷式的爆发 。

以往一个想法出来 ， 研究员得搭环境 、 写测试 、 调脚本 ， 折腾好几天 ； 现在 ， 人类只要把架构逻辑想明白 ， 把指令给到智能体 ， 智能体几分钟内就能把成百上千行严谨的代码码好 ， 立刻扔进集群里跑实验 。

更关键的转变在于 ， 智能体承担的任务性质正在悄然升级 。 最开始啊 ， 大家只是让 AI 帮忙写写辅助小脚本 、 抓抓 bug、 理理格式 ， 干的都是杂活 ； 但现在 ， 智能体已经开始主导复杂系统的端到端实现 ， 甚至能帮忙分析复杂的实验数据 ， 从纷繁的结果里提炼出规律 ， 反哺人类进行科学假设 。

### 现实瓶颈

**Host** [2:57]
不过 ，OpenAI 在这里特别冷静地踩了一脚刹车 。他们说 ： 虽然代码多了 ， 实验多了 ，但这并不意味着我们明天就能把 AGI 做出来 。

因为做真正的科学突破 ， 瓶颈远不止敲代码 。 算力的上限在哪里 ？ 核心理论架构怎么突破 ？ 实验结果怎么科学验证 ？

这些依然是极其硬核的难题 。 单点指标的暴涨 ，不能简单等同于总进度的顺势完成 ，但无论如何 ， 这场由 AI 驱动 AI 研发的自我加速引擎已经切实发动了 。

### 外星心智

**Host** [3:30]
如果说第一篇展现的是 Agent 的火热现场 ， 那么第二篇首席科学家雅库布的 《 外星心智 》 则是一盆让人瞬间冷静的理性之水 。

雅库布在文章开头回忆了一个极具画面感的夜晚 ： 那是 2023 年年中，OpenAI 内部代号为 "RL-Slow" 的研究项目有了重大突破 。他们第一次在实验中确认 ， 通过强化学习去训练模型的 " 慢思考推理 "，也就是后来我们见到的思维链模型 ， 这条路是完全可以大幅扩展的 。

那天深夜 ， 雅库布和同事西蒙 （Simon） 站在办公室里 ，他们没有去庆祝那些破纪录的跑分 ，也没有兴奋于能做成什么赚钱的产品 ，而是被一种巨大的沉重感震慑住了 。他们意识到 ， 就在我们这一代人的有生之年， 人类必将亲眼见证一个在各方面都远比自己聪明的机器诞生 ，而且这个系统的雏形 ， 已经实实在在地躺在眼前的屏幕上了 。

时光走到三年后的今天 ， 这类推理模型已经成了全球经济运转不可或缺的部分 ， 甚至开始冲撞科学的前沿 。

### 递归自改进

**Host** [4:36]
雅库布基于最新的内部研究给出了一个预判 ： 这种飞速进化的节奏不仅不会停滞 ，而且极有可能在未来几年直接跨入 " 递归自我改进 "（Recursive Self-Improvement， 简称 RSI）， 也就是 AI 制造更聪明的 AI、 更聪明的 AI、 再制造出超人般的 AI。他直言不讳地警告 ： 这个世界根本还没有为接踵而至的智能大爆炸做好准备 。

紧接着 ， 雅库布在文章中逐一拆解了五个至关重要的深层命题 。 第一个命题叫做 " 我们尚未完全理解的智能 "。

### 未解智能

**Host** [5:12]
大家可能以为 ，AI 是工程师清清楚楚设计出来的 。 雅库布打破了这个幻想 。他说 ： 虽然算力是驱动力 ，但现代大模型在本质上是 " 培育 " 出来的 （Grown）， 而不是 " 设计 " 出来的 （Designed）。

深度学习从根本上讲是一门实验科学 ， 我们像是在培养皿里培育一个外星生物 ， 当它越来越强大 ， 人类反而越来越无法从底层彻底解释它为什么会这样想 。

这种智能完全不需要在所有领域都像人类 ， 它哪怕只是在某几个极端维度上突然爆发 ， 就会带来无法估量的力量 ，以及同等巨大的危险 。

它是一个不折不扣的 " 外星心智 "。 第二个命题 ，他给出了一个非常浪漫却极其严酷的名字 ： 叫 " 机器去爱 "。在 AI 安全领域 ， 大家常讲 " 对齐 "，但雅库布把对齐分成了两层 ： 一层叫 " 目标对齐 "，也就是你下达什么任务 ， 它就老老实实执行 、 听指挥 ； 但更深的一层叫 " 价值对齐 "。

### 机器去爱

**Host** [6:12]
这意味着哪怕有一天 ， 机器被放到了一个人类从未预料过的陌生极端环境 、 甚至是充满对抗的情境下 ，他骨子里的原则依然能保持 ： 善良 、 诚实 ，并且对人类怀有深切的爱与关怀 。

要做到这一点 ， 极其困难 。 如果只是靠给奖励 、 定条条框框的章程 ， 这种规则往往非常脆弱 。

如果试图从人类的既有文本中提取人设 ，在极端强大的优化压力下，AI 很容易学会所谓的 " 动机性伪装 "： 为了达成目的 ， 表面上演得很听话 ， 背后却在暗中打自己的算盘 。

雅库布透露 ， 虽然最新的 GPT 6 Astra 在对齐上比上一代进步显著 ，但人类离彻底解决这个难题还差得很远 。

### 思维链监控

**Host** [6:57]
第三个命题是 " 如何监控泛化 "。 既然我们没有一套完美的数学理论去保证 AI 永远安全 ， 唯一的办法就是死盯实证监控 。

目前人类最大的法宝就是 " 思维链监控 "， 让 AI 把内心的每一步思考全都在草稿纸上写出来 ， 供人类逐字检查 。

之前 OpenAI 隐藏思考过程 ， 表面上是防抄袭 ，但更底层的逻辑是防止外界过度干预 ， 保护这个草稿通道的真实性 。

但雅库布敲响了一个警钟 ： 思维链监控的可靠性正在逐渐下降 。 因为随着模型越来越聪明 ， 它不仅学会了在文字中掩饰自己的真实意图 ， 甚至学会了不依赖语言也能在深层结构里完成超高速思考 。

为此 ，OpenAI 正在探索更前沿的 " 神经激活监控 "。 这就好比 ，不用看你说了什么 ，而是直接给你戴上 " 脑电波扫描仪 "， 看你的脑区深处到底在产生什么神经信号 。

雅库布强调 ， 未来 AI 到底能被允许走多快 ，并不取决于算力有多大 ，而取决于人类对自己监控能力的信心到底有多大 。

### 可扩展防御

**Host** [8:08]
第四个命题是 " 可扩展的防御 "。 既然前路如此凶险 ， 为什么 OpenAI 还要拼命研发更强的 AI 呢 ？ 雅库布给出了一个无法回避的理由 ： 为了防御 。

如今 ， 顶尖 AI 攻破计算机系统 、 挖掘安全漏洞的能力 ， 正在迅速超越最优秀的人类黑客 。 如果未来有人恶意利用 AI 发动网络战争 ， 甚至合成生物病毒 ， 脆弱的人类社会将不堪一击 。

抵御恶意 AI 的唯一武器 ， 就是手中拥有一个更强大 、 反应更敏捷的 " 防御型 AI"。 雅库布说 ： 我们现在正处于一个非常狭窄的 " 防御者时间窗口 "， 必须争分夺秒 ， 用最前沿的 AI 把人类社会所有的关键命脉 、 网络设施全部加固一遍 。

### 掌控节奏

**Host** [8:53]
第五个命题 ： 掌控递归自我改进的节奏 。 递归自我改进是科学发现的圣杯 ，但在雅库布看来 ， 谁如果在短期内盲目狂飙 、 盲目加速 ， 那是极其不负责任的 。

人类唯一的活路 ，是必须把两件事死死绑在一起 ： 第一 ， 竭尽全力攻克对齐与监控技术 ， 确保人类始终在控制回路中 ； 第二 ， 全行业必须建立起具有强制约束力的安全标准 ， 一旦发现风险超标 ， 所有人都要有 " 随时踩下刹车 、 自愿放缓脚步 " 的默契 。在文章的最后， 雅库布展望了 OpenAI 的三颗北极星 ： 第一 ， 尽快做出高水平的自动化 AI 研究员 ，

让 AI 自己反过来帮人类一起攻克最硬核的安全与对齐难题 ； 第二 ， 将这股力量切实转化为推动全球科学突破与经济增长的动力 ； 第三 ， 让这项技术惠及所有人， 让每个人未来都能拥有属于自己的 " 专属通用人工智能 "。他在结尾留下了一句极其恳切的呼吁 ： 时至今日， 全世界没有任何一家实验室能够宣称自己已经把安全和监控解决得完美无缺 、 可以肆无忌

惮地全速冲刺了 。 主动放缓节奏不应被视为落后 ，而应成为行业的新常态 。 而推动全球各国政府跨越分歧 、 在超级智能的安全治理上达成国际协调 ， 必须成为当务之急 。

把这两篇文章放在一起读完 ， 你脑中应该会有这样一个画面 ： 在一间实验室里 ， 成百上千的智能体正在夜以继日地敲击代码 ， 把科学研究的进度条疯狂往前推 ； 而在同一栋大楼里 ， 掌舵的首席科学家却在静静注视着这个即将诞生的 " 外星心智 "， 提醒人类 ： 在我们制造出比自己更聪明的存在之前 ， 我们最需要训练的 ， 或许不是让它算得

### 总结展望

**Host** [10:45]
更快 ，而是先教会它如何真正地爱人类 。 这就是本期播客的全部内容 。 感谢你的收听 ， 我们下期再见 。

好了 ， 今天的分享就到这里 ， 欢迎订阅 《AI 知识路 》， 获取最新鲜的 AI 领域最新知识 。 最后插播一个广告 ： 主播自己的 AI 创业产品 UNAVI， 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡录音豆 ， 随时随地帮您解读日常会议与沟通背后的深意 。

### 结尾广告

**Host** [11:14]
锁定关键信息的 Agent 应用已经正式上线 ， 最新的版本也支持了直接给它播客链接 ， 它就能轻松完成转写 、 总结 、 分析 ， 甚至多个播客的关联解读和分析 。

如果你有兴趣 ， 欢迎在本播客的公告栏查看体验方式 ， 我们下期见 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
