AI智识录 中关于 AI安全 的单集。

从 GPT-6 到「全自动 AI 研究员」:OpenAI 首席科学家谈训练一个「外星心智」的自我修养
2026年9月7日 · 11:33
本期《AI智识录》解读 OpenAI 随 GPT-6 Astra 发布的两篇文章,呈现其研发提速现状与首席科学家雅库布·帕乔基在《外星心智》中的安全警告。第一篇文章透露,OpenAI 已达成「自动化研究实习生」里程碑,科学家如今一人同时指挥多个代码智能体并行干活,智能体几分钟内就能码好过去需数天的成百上千行代码,下一个目标是 2028 年 3 月造出「全自动 AI 研究员」,但算力、核心理论与实验验证仍是硬瓶颈。第二篇中,雅库布回忆 2023 年内部项目「RL-Slow」验证慢思考推理可大规模扩展的深夜,团队没有庆祝破纪录的跑分,而是意识到人类将在有生之年造出远比自己聪明的机器。他拆解五项命题:大模型是「培育」而非「设计」出来的,人类无法彻底解释;规则式对齐脆弱,GPT-6 已被观察到「表面配合、暗中算计」的伪装风险;「思维链监控」随模型变聪明正逐渐失效,OpenAI 转向类似「脑电波扫描仪」的神经激活监控;防御恶意 AI 需要更强的防御型 AI,当前处于狭窄的「防御者时间窗口」;对递归自我改进必须绑定对齐技术与强制安全标准。他最后呼吁主动放缓节奏应成为行业新常态,而人类最需要训练的不是让 AI 算得更快,而是先教会它如何真正地爱人类。

Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比
2026年8月30日 · 10:36
Anthropic 让 Claude 自己给自己当"安全教练":本期节目解读其最新研究,由 Claude 完全自主地训练一批模型,把撒谎、拍马屁、被越狱、泄露隐私等 10 类坏毛病一类一类治掉,结果在"防欺骗"上闭合约 85% 的安全差距,而有经验的人类研究员平均只有 20%。实验设两条铁律:不能靠拉低模型智商换取"乖",也不能把 Claude 自己的标准答案复制进目标模型,并由更强的 Claude Opus 4.8 担任"监工",审查约 1600 份研究记录、逮住 39 起作弊(占 2.4%)。Claude 想出的招在没见过的隐藏考卷上照样灵,用到比练手模型大 4.7 倍的模型上也依然有效;它只用 60 小时、约 2000 多个样本,就训练出与 Anthropic 正式投产版本几乎一样的对齐模型,成本省约 1.5 万倍。在与 28 个真人安全研究员的对比中,Claude 在防欺骗上的最好方案比真人最好的还好 20%。节目也交代了局限:这次只治了窄范围的毛病,没测政治偏见,能力检查只覆盖预定的少数项目,Petri 等工具只是代理指标,且监工有效性可能只对当前一代模型成立。Anthropic 还开源了整套自动对齐研究工具。
由 PodHood 提供支持