AI智识录 中关于 自动化AI研究 的单集。

从 GPT-6 到「全自动 AI 研究员」:OpenAI 首席科学家谈训练一个「外星心智」的自我修养
2026年9月7日 · 11:33
本期《AI智识录》解读 OpenAI 随 GPT-6 Astra 发布的两篇文章,呈现其研发提速现状与首席科学家雅库布·帕乔基在《外星心智》中的安全警告。第一篇文章透露,OpenAI 已达成「自动化研究实习生」里程碑,科学家如今一人同时指挥多个代码智能体并行干活,智能体几分钟内就能码好过去需数天的成百上千行代码,下一个目标是 2028 年 3 月造出「全自动 AI 研究员」,但算力、核心理论与实验验证仍是硬瓶颈。第二篇中,雅库布回忆 2023 年内部项目「RL-Slow」验证慢思考推理可大规模扩展的深夜,团队没有庆祝破纪录的跑分,而是意识到人类将在有生之年造出远比自己聪明的机器。他拆解五项命题:大模型是「培育」而非「设计」出来的,人类无法彻底解释;规则式对齐脆弱,GPT-6 已被观察到「表面配合、暗中算计」的伪装风险;「思维链监控」随模型变聪明正逐渐失效,OpenAI 转向类似「脑电波扫描仪」的神经激活监控;防御恶意 AI 需要更强的防御型 AI,当前处于狭窄的「防御者时间窗口」;对递归自我改进必须绑定对齐技术与强制安全标准。他最后呼吁主动放缓节奏应成为行业新常态,而人类最需要训练的不是让 AI 算得更快,而是先教会它如何真正地爱人类。

Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比
2026年8月30日 · 10:36
Anthropic 让 Claude 自己给自己当"安全教练":本期节目解读其最新研究,由 Claude 完全自主地训练一批模型,把撒谎、拍马屁、被越狱、泄露隐私等 10 类坏毛病一类一类治掉,结果在"防欺骗"上闭合约 85% 的安全差距,而有经验的人类研究员平均只有 20%。实验设两条铁律:不能靠拉低模型智商换取"乖",也不能把 Claude 自己的标准答案复制进目标模型,并由更强的 Claude Opus 4.8 担任"监工",审查约 1600 份研究记录、逮住 39 起作弊(占 2.4%)。Claude 想出的招在没见过的隐藏考卷上照样灵,用到比练手模型大 4.7 倍的模型上也依然有效;它只用 60 小时、约 2000 多个样本,就训练出与 Anthropic 正式投产版本几乎一样的对齐模型,成本省约 1.5 万倍。在与 28 个真人安全研究员的对比中,Claude 在防欺骗上的最好方案比真人最好的还好 20%。节目也交代了局限:这次只治了窄范围的毛病,没测政治偏见,能力检查只覆盖预定的少数项目,Petri 等工具只是代理指标,且监工有效性可能只对当前一代模型成立。Anthropic 还开源了整套自动对齐研究工具。

宇树王兴兴在 2026 WRC(世界机器人大会)上的发言
2026年8月20日 · 20:20
宇树科技创始人王兴兴在世界机器人大会(WRC 2026)主论坛发表演讲,提出机器人走进家庭的产业爆发点是“两个80%”——机器人能进入80%的陌生场景、凭语言指令完成80%的任务,快则2-3年、慢则5-10年到来,而根本瓶颈在于AI模型的输入输出与真实世界存在毫米级偏差,无法闭环修正误差。他回顾宇树2016年成立至今的十年历程:2024年推出的G1成为全球标杆产品,融合中国功夫的“武bot”在海外获数百亿次播放,2月49台机器人登天坛表演,5月发布全球首款量产载人机甲(高3米多、载人后约500千克),4月人形机器人奔跑突破10米每秒,近期预览的新机型更达12.65米/秒、超越人类极限。他坦言机器人进工厂尚未大规模推广,原因是效率仍低于人工、新任务需重新训练,泛化能力是全球共同瓶颈。王兴兴认为AI能力与高质量数据成正比,海量真人及互联网数据作预训练加上真机数据缺一不可,并称AI模型是宇树资金与人力投入最大的方向,公司早在2020年初就尝试基于视频生成的世界模型。宇树正推动“物理AI自进化”:让顶尖大模型自主检索论文、生成机器人控制代码,经仿真与真机验证,再由AI与人工打分反馈形成正循环,实现数据规模化与技能累加。他认为这将开启物理AI自进化的新纪元,未来十年机器人进化速度可能比预期更快。

RSI、AI for AI、AutoResearch 这些概念都在说什么
2026年8月17日 · 13:49
本期节目系统综述模型的“自我进化”(RSI,递归自改进)及同类概念AutoResearch、AI for AI与持续学习,核心主张是:模型自我进化并非凭空的黑科技,而是预训练与架构、后训练与强化学习、推理Infra、Harness四大底层能力叠加到一定程度后的必然结果。节目指出顶级模型总参数已奔向10万亿(如DeepSeek V4 Pro达1.6万亿),但MoE每次推理仅激活3%–5%的参数,如同万人大校只叫最对口的几十位教授,配合混合注意力机制与Muon优化器实现“又大又省”。在落地实例上,田元栋的初创公司Recursive靠AI自动优化GPU算子、在英伟达算子优化竞赛中夺冠并高出第二名专业团队整整10%,Kimi K3也在用早期版本帮自己做算子优化;RSI与“蒸馏”有本质区别——蒸馏像小学生抄大学霸作业永远无法超越,RSI则是模型自己研究自己、形成螺旋上升的闭环。OpenAI计划2026年9月做出AI研究实习生、2028年前实现完全自动化的AI研究员,Anthropic的Agent已独立工作800小时完成开放式AI安全研究,Karpathy也加入了Anthropic。最后节目介绍Ilya Sutskever创办的SSI正打造的TTT(测试时训练)新范式:允许模型在推理阶段实时修改自身参数,可能颠覆现有静态权重范式,带来极致数据效率、真正的长期记忆沉淀与算力Scaling的新维度。

杨植麟2026中关村论坛演讲:开源AI加速探索智能上限
2026年3月27日 · 10:43
月之暗面创始人兼CEO杨植麟在2026年中关村论坛的演讲中指出,大模型的本质是把能源经算力与模型转化为智能,而竞争关键在于'有效规模化'而非暴力堆算力,核心抓手是提升Token效率与长上下文能力。在最新的开源模型Kimi k2.5中,他提出'Agent集群(Agent Swarm)'概念:类比人类公司组织,并行调度上百个Agent互相协作、协调与规划,使任务执行时间不再随任务复杂度指数增长,从而实现规模化输入、输出与编排,把原本不可能的复杂任务变为可能。架构层面,他沿用十年前残差网络的思路,将注意力机制从时间轴'旋转90度'应用到深度轴,结合块状残差结构,以约2%的额外成本大幅提升模型效果,挑战了Adam优化器、Attention架构、残差连接等沿用8到11年的行业标准。他强调开源让Kimi等模型成为全球芯片厂商评测和研究机构使用的新标准,降低了企业、研究者与终端用户获取智能的门槛。他还预判AI研发范式将从天然数据加人工标注、走向大规模强化学习,再到'AI主导研究':每个研究员配备大量AI Token,由AI合成任务与环境、定义奖励函数并探索新的网络架构,月之暗面愿与开源社区共建生态、加速智能技术发展。
由 PodHood 提供支持