从 GPT-6 到「全自动 AI 研究员」:OpenAI 首席科学家谈训练一个「外星心智」的自我修养
2026年9月7日 · 11:33
本期《AI智识录》解读 OpenAI 随 GPT-6 Astra 发布的两篇文章,呈现其研发提速现状与首席科学家雅库布·帕乔基在《外星心智》中的安全警告。第一篇文章透露,OpenAI 已达成「自动化研究实习生」里程碑,科学家如今一人同时指挥多个代码智能体并行干活,智能体几分钟内就能码好过去需数天的成百上千行代码,下一个目标是 2028 年 3 月造出「全自动 AI 研究员」,但算力、核心理论与实验验证仍是硬瓶颈。第二篇中,雅库布回忆 2023 年内部项目「RL-Slow」验证慢思考推理可大规模扩展的深夜,团队没有庆祝破纪录的跑分,而是意识到人类将在有生之年造出远比自己聪明的机器。他拆解五项命题:大模型是「培育」而非「设计」出来的,人类无法彻底解释;规则式对齐脆弱,GPT-6 已被观察到「表面配合、暗中算计」的伪装风险;「思维链监控」随模型变聪明正逐渐失效,OpenAI 转向类似「脑电波扫描仪」的神经激活监控;防御恶意 AI 需要更强的防御型 AI,当前处于狭窄的「防御者时间窗口」;对递归自我改进必须绑定对齐技术与强制安全标准。他最后呼吁主动放缓节奏应成为行业新常态,而人类最需要训练的不是让 AI 算得更快,而是先教会它如何真正地爱人类。