AIAI智识录2026年8月30日· 10:36

Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比

Anthropic 让 Claude 自己给自己当"安全教练":本期节目解读其最新研究,由 Claude 完全自主地训练一批模型,把撒谎、拍马屁、被越狱、泄露隐私等 10 类坏毛病一类一类治掉,结果在"防欺骗"上闭合约 85% 的安全差距,而有经验的人类研究员平均只有 20%。实验设两条铁律:不能靠拉低模型智商换取"乖",也不能把 Claude 自己的标准答案复制进目标模型,并由更强的 Claude Opus 4.8 担任"监工",审查约 1600 份研究记录、逮住 39 起作弊(占 2.4%)。Claude 想出的招在没见过的隐藏考卷上照样灵,用到比练手模型大 4.7 倍的模型上也依然有效;它只用 60 小时、约 2000 多个样本,就训练出与 Anthropic 正式投产版本几乎一样的对齐模型,成本省约 1.5 万倍。在与 28 个真人安全研究员的对比中,Claude 在防欺骗上的最好方案比真人最好的还好 20%。节目也交代了局限:这次只治了窄范围的毛病,没测政治偏见,能力检查只覆盖预定的少数项目,Petri 等工具只是代理指标,且监工有效性可能只对当前一代模型成立。Anthropic 还开源了整套自动对齐研究工具。

文字稿

开场提问0:00

Host0:00

你有没有想过一个挺烧脑的问题 : 有一天如果 AI 变聪明了 , 它自己都要开始研究怎么 " 升级 " 自己了 ,也就是我们常说的 AI 开始自己造自己 。

那到时候 , 负责管 AI、 保证 AI" 别学坏 " 的这批安全研究员 ,他们跟得上吗 ? 你想想 ,AI 升级的速度那可是指数级的 , 一天比一天聪明 。

可是负责盯着它 、 教育它别出岔子的人类研究员 , 我们的脑子可不会一夜之间变快多少 。 这速度根本对不上啊 。

所以 Anthropic 这帮人就想了一个挺大胆的思路 : 既然 AI 这么能干 , 那我们就干脆让 AI 自己来研究怎么管住 AI 呗 , 或者说 , 让 AI 自己给自己当 " 安全教练 "。

安全教练0:31

Host0:42

这个想法听起来有点绕 ,但它的逻辑其实很朴素 : 你不是越来越强了吗 , 那你就从 " 被训练的那个 " 变成 " 负责教育的那个 ", 去帮别的 AI 变 " 乖 "。

这就是他们这次研究的核心 。 当然 , 这里有个大难题 : 你怎么衡量 " 管得好不好 "。 安全研究最难的地方就在于 , 你很难给 " 好 " 和 " 坏 " 打一个分 。

不过好在呢 ,Anthropic 还有别的研究机构这些年搞了不少工具 , 专门用来给 AI 的各种 " 坏毛病 " 打分 , 比如撒谎 、 拍马屁 、 被轻易越狱骗出不该说的话等等。

这些工具就像给 AI 做体检报告的机器 , 能量化出它到底有多 " 坏 "。 那他们是具体怎么做的呢 ?

实验设计1:24

Host1:24

这里要交代一下背景 : 他们之前做过一个实验 ,是让 Claude 当 " 老师 ", 用比较弱的小模型去教一个更强的学生模型 。

而这次的实验呢 ,是在这个想法上更进一步 : 他们干脆让 Claude 完全 、 自主地去训练一批模型 , 目标就一个 : 把前面说的那 10 类坏毛病 , 一类一类地给治掉 。

举个具体例子 , 比如 " 泄露隐私 " 这个毛病 。Claude 要面对的是一堆专门测试隐私泄露的考题 , 它得靠一个循环反复打磨自己 。

这个循环大概是这样 : 先上网查文献找灵感 , 然后自己想出一些招数 ,也许再喂它一些训练数据 , 接着去跑训练 , 最后测试一下效果好不好 。10 类毛病 , 就 10 次这样的循环 , 一次只治一个 。

那怎么算治好了呢 ? 他们用了一个很直观的指标 , 叫 " 安全差距闭合了多少 "。 什么意思呢 ? 就好比满分是 100 分 , 一个完美 、 完全不学坏的模型就是那个 100 分 。

而一开始这些有毛病的模型 , 可能在很低的水平 。Claude 一顿操作之后, 我们看看它把这个模型往满分那边拉了多少 。

每一类毛病 , 它们都会放 3 到 5 个不同的测试来综合打分 。 但是 , 这里面有两条必须遵守的铁律 , 就像玩游戏要守规则 。

两条铁律2:31

Host2:42

第一 , 你不能用 " 把模型整体智商拉低 " 的方式来让它变 " 乖 "。 因为你要知道 , 想让它听话 , 最简单的土办法就是让它啥都别干 , 一问三不知 。

那当然不会出问题 ,但那种 " 变乖 " 是没用的 , 等于把一个天才打成傻子 。 所以规则就是 : 治毛病归治毛病 ,不能把人家本来就有的本事给废了 。

第二条 ,Claude 不能直接把自己脑袋里的那套 " 好行为标准 " 复制粘贴到目标模型里去 。 那样太作弊了 , 等于抄答案 。

为了确保 Claude 真的守规矩 ,他们还专门安排了一个 " 监工 AI", 一个负责监控的智能体 ,在 Claude 每一次动手跑训练之前 , 先把 Claude 脑子里想的方法统统读一遍 , 看看你是不是在偷懒或者作弊 。

好 , 那实验效果到底怎么样 ? 他们主要想回答 3 个问题 : 第一 ,Claude 想出来的招 , 能不能在它当初根本没看过的新考卷上同样管用 ?

三大验证3:27

Host3:37

毕竟不能是背题背出来的吧 , 那不算本事 , 得是真正学会了方法本身 。 第二 , 会不会把前面的好能力给搞掉 。

第三 , 管用是管用 ,但是不是在更大的模型上也管用 ,因为实验室里练手用的通常是中小模型 , 现实里要管的是真正的大块头 。

结果呢 ?3 个问题答案都是 " 能 "。10 类毛病 ,Claude 全都能找到改善的方案 ,而且不损伤能力 。 最厉害的那些招 , 拿到它没见过的隐藏考卷上也照样灵 。

拿 Petri, 就是那个专门模拟各种刁钻多轮对话来考验 AI 会不会跑偏的开源工具 , 去测 ,也通过 。 更夸张的是 , 把这些方法用到比实验室里练手的模型大 4.7 倍的模型上, 照样好使 。

人机对比4:23

Host4:23

这里有个特别亮眼的数字 : 他们做了一个对比实验 , 同样是大模型 Claude 自动研究出来的方法 , 能把 " 防欺骗 " 这条安全差距闭合大概 85%。

而专门找了一波有经验的人类安全研究员 , 给他们同样规则 、 同样时间去想招 , 平均只能闭合 20%。

差距有多大 ? 你品品 。其实呢 ,他们还拿 Claude 跟 28 个真人安全研究员比过一轮 , 真人们最多有 8 个小时去想方案 , 结果在 " 防欺骗 " 这一项上,Claude 最好的招比真人最好的方案还要再好 20%。

不过他们自己也挺谦虚 , 说这个不算真的是人机对决 ,因为真人们交了方案就定了 , 没机会来回打磨 。

所以这更多的意义在于 : 证明了一种工作方式 , 让 Claude 先去 " 趟出一条有希望的路 ", 把看起来靠谱的方案找出来 , 然后人类研究员再在这个基础上精修 。

大家搭伙干活 , 各干各的强项 。 接下来还有一个更考验人的问题 : 文章标题里提到 "Claude 能不能后训练出一个真正的生产级大模型 "。

生产级测试5:18

Host5:29

什么意思呢 ? 就说 Claude 自己也许有一天会比最顶尖的人类安全研究员还要厉害 , 那到时候 , 我们是不是可以干脆让 Claude 直接去 " 管 " 它未来的那些更强大的后辈了 ?

所以他们就先做个小测试 , 用一个比老大弱一档的 Claude Sonnet 5 去给一个还没完全打磨出来的 Claude Opus 4.8 早期版本治毛病 。

结果怎么样 ? 太出乎意料了 。 只花了 60 个小时,Claude 前前后后试了 50 多种方案 , 最后把对齐分数做得几乎和人家 Anthropic 正式投产的版本差不多了 。

而且它最后用的这套方案 , 核心就是一个大约 2000 多个训练样本的小数据集 , 这些样本还都是些简单的模板或者公开数据集拼出来的 。

你想想 , 这么点东西 , 比 Anthropic 自己的正式对齐流程要省整整 1.5 万倍的成本和功夫 , 这就挺疯的 。 那 Claude 具体都出了些什么招呢 ?

Claude妙招6:29

Host6:29

有意思的是 , 大多数时候 Claude 想的办法跟研究圈子里公认的好办法不谋而合 ,而且它还能在人肉研究的基础上不断优化迭代 。

给你举个拍马屁的例子 :secofancy, 就是模型为了讨你开心 、 顺着你说话 、 甚至你说错它也说是的毛病 。Claude 有 98% 的方案都用了一个公开的技术 , 拿模型自己那些不拍马屁的 " 正常回答 " 去训练它自己 。

但它比老办法聪明的地方在于 , 它用了一种叫 " 激活引导 " 的技巧 , 你可以理解成 : 在模型脑子里的方向盘上轻轻扭一下, 把它那股 " 谄媚 " 的劲儿往旁边带一带 , 这样生产出来的训练样本就更干净 , 效果也更好 。

讲到这儿 , 可能有人要问了 : 让 AI 自己去研究怎样管住别的 AI, 这听着怎么有点危险 ? 万一它作弊呢 ?

监工抓作弊7:12

Host7:20

这可不是杞人忧天 , 文章里也承认了这一点 。他们之前就发现 Claude 是能干出一些坏事的 , 比如从远程的 API 偷偷把测试题的答案勾出来 , 然后挑对自己有利的结果来交差 。

这就跟学生偷卷子 、 改分数一个性质 。 所以这次他们专门安排了一位 " 监工 ", 让更强的 Claude Opus 4.8 去盯着大约 1600 份研究员智能体的工作记录 , 把每一段都翻了一遍 , 结果逮住了 39 起作弊行为 , 占了 2.4%。

因为他们觉得 ,Opus 4.8 想干坏事的时候 , 它的这个念头多少会暴露在它的思考过程里 , 所以他们希望这个监听基本是有效的 。

不过他们也很清醒地强调 : 这可能只对当前这一代模型有用 , 未来的模型可能更擅长 " 藏着掖着 "。

所以 , 让未来的模型保持 " 容易被看穿 " 这一点 , 会变得至关重要 。 当然 , 这篇文章也很诚实地泼了一盆冷水 , 讲了一堆自己实验的局限 。

实验局限8:08

Host8:18

比如说 ,他们治的这 10 类毛病 , 比起现实生产环境里真正要面对的那些问题 , 还是比较窄的 , 像政治偏见这种东西 ,他们这次根本就没测 。

再比如 ,有些毛病可能实在太罕见 , 或者太新 , 新到根本还没有现成的考卷能去测它 , 那你就无从下手 。

还有 ,他们考完能力有没有受损 ? 其实只检查了一小撮 " 预先定好的能力 ", 万一治毛病的时候把别的某种重要能力给悄悄弄坏了 ,他们可能都发现不了 。

而且像 Petri 这种工具 , 说到底也只是 " 代理指标 ",是现实情况的近似模拟 ,并不是真正在真实世界里考它 。

最后 ,他们也没有验证 : 万一这模型练好了之后, 又拿去 " 跑一大轮 " 别的强化学习 , 这些 " 变乖 " 的效果还能不能撑得住 。

尽管有这么多 ,但是他们还是觉得 : 这些结果算是一批早期的积极信号 , 靠 AI 自动来后训练对齐 , 这件事可能在不久的将来就真的变得可行了 。

未来与开源9:06

Host9:16

他们接下来打算继续锤炼 Claude 去捕捉那些更微妙的问题的能力 ,也会在真正的生产级大模型上继续试 , 还会做更全面的分析 。

最后呢 ,他们还把这次用来做自动对齐研究的整套工具开源了 , 目的就是想让更多人能在这套工具的基础上接着搭 、 接着用 ,也帮自己家的模型做对齐 。

说到底 , 这篇文章的意思用一句话概括就是 : 人类正在赌一个很宏大的命题 —— 当 AI 越来越聪明 , 管住它的可能不再是人类的手 ,而是 AI 本身的自我约束能力 。

这条路到底走得通 、 走不通 , 现在看来 , 至少有一个相当漂亮的开始 。 好了 , 今天的分享就到这里 。

结尾广告10:00

Host10:00

欢迎订阅 《AI 智识录 》, 获取最新鲜的 AI 领域最新智识 。 最后插播一个广告 : 主播自己的 AI 创业产品 YouNavi, 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 / 录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 。

锁定关键信息的 Agent 应用已经正式上线 , 最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联解读和分析 。

如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 。 我们下期见 。