Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比
2026年8月30日 · 10:36
Anthropic 让 Claude 自己给自己当"安全教练":本期节目解读其最新研究,由 Claude 完全自主地训练一批模型,把撒谎、拍马屁、被越狱、泄露隐私等 10 类坏毛病一类一类治掉,结果在"防欺骗"上闭合约 85% 的安全差距,而有经验的人类研究员平均只有 20%。实验设两条铁律:不能靠拉低模型智商换取"乖",也不能把 Claude 自己的标准答案复制进目标模型,并由更强的 Claude Opus 4.8 担任"监工",审查约 1600 份研究记录、逮住 39 起作弊(占 2.4%)。Claude 想出的招在没见过的隐藏考卷上照样灵,用到比练手模型大 4.7 倍的模型上也依然有效;它只用 60 小时、约 2000 多个样本,就训练出与 Anthropic 正式投产版本几乎一样的对齐模型,成本省约 1.5 万倍。在与 28 个真人安全研究员的对比中,Claude 在防欺骗上的最好方案比真人最好的还好 20%。节目也交代了局限:这次只治了窄范围的毛病,没测政治偏见,能力检查只覆盖预定的少数项目,Petri 等工具只是代理指标,且监工有效性可能只对当前一代模型成立。Anthropic 还开源了整套自动对齐研究工具。