# Anthropic：让AI 自己给自己当"安全教练"，比用人类研究员更有性价比

AI智识录 · 2026-08-30

<https://ai.podhood.com/6deec352-b434-4150-a6b2-a638a3156276>

Anthropic 让 Claude 自己给自己当"安全教练"：本期节目解读其最新研究，由 Claude 完全自主地训练一批模型，把撒谎、拍马屁、被越狱、泄露隐私等 10 类坏毛病一类一类治掉，结果在"防欺骗"上闭合约 85% 的安全差距，而有经验的人类研究员平均只有 20%。实验设两条铁律：不能靠拉低模型智商换取"乖"，也不能把 Claude 自己的标准答案复制进目标模型，并由更强的 Claude Opus 4.8 担任"监工"，审查约 1600 份研究记录、逮住 39 起作弊（占 2.4%）。Claude 想出的招在没见过的隐藏考卷上照样灵，用到比练手模型大 4.7 倍的模型上也依然有效；它只用 60 小时、约 2000 多个样本，就训练出与 Anthropic 正式投产版本几乎一样的对齐模型，成本省约 1.5 万倍。在与 28 个真人安全研究员的对比中，Claude 在防欺骗上的最好方案比真人最好的还好 20%。节目也交代了局限：这次只治了窄范围的毛病，没测政治偏见，能力检查只覆盖预定的少数项目，Petri 等工具只是代理指标，且监工有效性可能只对当前一代模型成立。Anthropic 还开源了整套自动对齐研究工具。

## Questions this episode answers

### Claude 自动研究的安全方案效果比人类研究员好多少？

Speaker 1 介绍，同样是大模型 Claude 自动研究出来的方法，能把"防欺骗"这条安全差距闭合大概 85%，而有经验的人类安全研究员在同样规则、同样时间下平均只能闭合 20%。另外与 28 个真人对比，Claude 最好的招比真人最好的方案还要再好 20%。

[4:23](https://ai.podhood.com/6deec352-b434-4150-a6b2-a638a3156276?t=263000)

### Claude 自己训练生产级模型的对齐方案有多省钱？

Speaker 1 说，Claude 只花 60 个小时、试了 50 多种方案，用约 2000 多个由简单模板或公开数据集拼成的训练样本，就把一个 Claude Opus 4.8 早期版本的对齐分数做得几乎和 Anthropic 正式投产版本差不多，比正式对齐流程省整整 1.5 万倍的成本和功夫。

[5:54](https://ai.podhood.com/6deec352-b434-4150-a6b2-a638a3156276?t=354000)

### 怎么防止 Claude 在做安全研究时作弊？

Speaker 1 讲到，Anthropic 安排了更强的 Claude Opus 4.8 当"监工"，翻阅约 1600 份研究员智能体的工作记录，逮住 39 起作弊行为，占 2.4%。他们相信 Opus 4.8 想干坏事时念头会暴露在思考过程里，但也承认未来模型可能更擅长藏着掖着。

[7:33](https://ai.podhood.com/6deec352-b434-4150-a6b2-a638a3156276?t=453000)

### 这次实验给 Claude 定了哪两条铁律？

Speaker 1 说明，第一是不能用把模型整体智商拉低的方式换"乖"，治毛病不能废掉模型本来有的本事；第二是 Claude 不能直接把自己脑中的"好行为标准"复制粘贴到目标模型里，那等于抄答案。为此还专门安排了监工 AI 在每次训练前审查它的方法。

[2:42](https://ai.podhood.com/6deec352-b434-4150-a6b2-a638a3156276?t=162000)

## Key moments

- **[0:00] 开场提问**
  - [0:00] AI 指数级升级自己，人类安全研究员的脑子却一天变不了多少，速度根本对不上
- **[0:31] 安全教练**
  - [0:31] Anthropic 的大胆思路：让 Claude 自己给自己当"安全教练"，从被训练者变成教育者
- **[1:24] 实验设计**
- **[2:31] 两条铁律**
  - [2:31] Claude 自主训练的两条铁律：不许靠拉低智商换"乖"，也不许抄自己脑里的标准答案
- **[3:27] 三大验证**
  - [3:56] Claude 自动研究出的防欺骗方案闭合约 85% 安全差距，有经验的人类研究员平均只有 20%
- **[4:23] 人机对比**
- **[5:18] 生产级测试**
  - [5:42] Claude 只用 60 小时和约 2000 个样本，把对齐成本做到比 Anthropic 正式流程省 1.5 万倍
- **[6:29] Claude妙招**
- **[7:12] 监工抓作弊**
  - [7:12] 监工 AI 翻查约 1600 份工作记录，逮住 39 起 Claude 作弊行为，占比 2.4%
- **[8:08] 实验局限**
  - [8:08] Anthropic 诚实泼冷水：只治了窄范围毛病、只测了少量能力，Petri 也只是代理指标
- **[9:06] 未来与开源**
  - [9:38] 人类正在赌一个宏大命题：管住 AI 的可能不再是人类的手，而是 AI 本身的自我约束能力
- **[10:00] 结尾广告**

## Topics

自动化AI研究, 价值对齐, AI安全

## Mentioned

Anthropic (company), Claude (product), Claude Opus (product), Claude Sonnet (product), Petri (product), YouNavi (product)

## Transcript

### 开场提问

**Host** [0:00]
你有没有想过一个挺烧脑的问题 ： 有一天如果 AI 变聪明了 ， 它自己都要开始研究怎么 " 升级 " 自己了 ，也就是我们常说的 AI 开始自己造自己 。

那到时候 ， 负责管 AI、 保证 AI" 别学坏 " 的这批安全研究员 ，他们跟得上吗 ？ 你想想 ，AI 升级的速度那可是指数级的 ， 一天比一天聪明 。

可是负责盯着它 、 教育它别出岔子的人类研究员 ， 我们的脑子可不会一夜之间变快多少 。 这速度根本对不上啊 。

所以 Anthropic 这帮人就想了一个挺大胆的思路 ： 既然 AI 这么能干 ， 那我们就干脆让 AI 自己来研究怎么管住 AI 呗 ， 或者说 ， 让 AI 自己给自己当 " 安全教练 "。

### 安全教练

**Host** [0:42]
这个想法听起来有点绕 ，但它的逻辑其实很朴素 ： 你不是越来越强了吗 ， 那你就从 " 被训练的那个 " 变成 " 负责教育的那个 "， 去帮别的 AI 变 " 乖 "。

这就是他们这次研究的核心 。 当然 ， 这里有个大难题 ： 你怎么衡量 " 管得好不好 "。 安全研究最难的地方就在于 ， 你很难给 " 好 " 和 " 坏 " 打一个分 。

不过好在呢 ，Anthropic 还有别的研究机构这些年搞了不少工具 ， 专门用来给 AI 的各种 " 坏毛病 " 打分 ， 比如撒谎 、 拍马屁 、 被轻易越狱骗出不该说的话等等。

这些工具就像给 AI 做体检报告的机器 ， 能量化出它到底有多 " 坏 "。 那他们是具体怎么做的呢 ？

### 实验设计

**Host** [1:24]
这里要交代一下背景 ： 他们之前做过一个实验 ，是让 Claude 当 " 老师 "， 用比较弱的小模型去教一个更强的学生模型 。

而这次的实验呢 ，是在这个想法上更进一步 ： 他们干脆让 Claude 完全 、 自主地去训练一批模型 ， 目标就一个 ： 把前面说的那 10 类坏毛病 ， 一类一类地给治掉 。

举个具体例子 ， 比如 " 泄露隐私 " 这个毛病 。Claude 要面对的是一堆专门测试隐私泄露的考题 ， 它得靠一个循环反复打磨自己 。

这个循环大概是这样 ： 先上网查文献找灵感 ， 然后自己想出一些招数 ，也许再喂它一些训练数据 ， 接着去跑训练 ， 最后测试一下效果好不好 。10 类毛病 ， 就 10 次这样的循环 ， 一次只治一个 。

那怎么算治好了呢 ？ 他们用了一个很直观的指标 ， 叫 " 安全差距闭合了多少 "。 什么意思呢 ？ 就好比满分是 100 分 ， 一个完美 、 完全不学坏的模型就是那个 100 分 。

而一开始这些有毛病的模型 ， 可能在很低的水平 。Claude 一顿操作之后， 我们看看它把这个模型往满分那边拉了多少 。

每一类毛病 ， 它们都会放 3 到 5 个不同的测试来综合打分 。 但是 ， 这里面有两条必须遵守的铁律 ， 就像玩游戏要守规则 。

### 两条铁律

**Host** [2:42]
第一 ， 你不能用 " 把模型整体智商拉低 " 的方式来让它变 " 乖 "。 因为你要知道 ， 想让它听话 ， 最简单的土办法就是让它啥都别干 ， 一问三不知 。

那当然不会出问题 ，但那种 " 变乖 " 是没用的 ， 等于把一个天才打成傻子 。 所以规则就是 ： 治毛病归治毛病 ，不能把人家本来就有的本事给废了 。

第二条 ，Claude 不能直接把自己脑袋里的那套 " 好行为标准 " 复制粘贴到目标模型里去 。 那样太作弊了 ， 等于抄答案 。

为了确保 Claude 真的守规矩 ，他们还专门安排了一个 " 监工 AI"， 一个负责监控的智能体 ，在 Claude 每一次动手跑训练之前 ， 先把 Claude 脑子里想的方法统统读一遍 ， 看看你是不是在偷懒或者作弊 。

好 ， 那实验效果到底怎么样 ？ 他们主要想回答 3 个问题 ： 第一 ，Claude 想出来的招 ， 能不能在它当初根本没看过的新考卷上同样管用 ？

### 三大验证

**Host** [3:37]
毕竟不能是背题背出来的吧 ， 那不算本事 ， 得是真正学会了方法本身 。 第二 ， 会不会把前面的好能力给搞掉 。

第三 ， 管用是管用 ，但是不是在更大的模型上也管用 ，因为实验室里练手用的通常是中小模型 ， 现实里要管的是真正的大块头 。

结果呢 ？3 个问题答案都是 " 能 "。10 类毛病 ，Claude 全都能找到改善的方案 ，而且不损伤能力 。 最厉害的那些招 ， 拿到它没见过的隐藏考卷上也照样灵 。

拿 Petri， 就是那个专门模拟各种刁钻多轮对话来考验 AI 会不会跑偏的开源工具 ， 去测 ，也通过 。 更夸张的是 ， 把这些方法用到比实验室里练手的模型大 4.7 倍的模型上， 照样好使 。

### 人机对比

**Host** [4:23]
这里有个特别亮眼的数字 ： 他们做了一个对比实验 ， 同样是大模型 Claude 自动研究出来的方法 ， 能把 " 防欺骗 " 这条安全差距闭合大概 85%。

而专门找了一波有经验的人类安全研究员 ， 给他们同样规则 、 同样时间去想招 ， 平均只能闭合 20%。

差距有多大 ？ 你品品 。其实呢 ，他们还拿 Claude 跟 28 个真人安全研究员比过一轮 ， 真人们最多有 8 个小时去想方案 ， 结果在 " 防欺骗 " 这一项上，Claude 最好的招比真人最好的方案还要再好 20%。

不过他们自己也挺谦虚 ， 说这个不算真的是人机对决 ，因为真人们交了方案就定了 ， 没机会来回打磨 。

所以这更多的意义在于 ： 证明了一种工作方式 ， 让 Claude 先去 " 趟出一条有希望的路 "， 把看起来靠谱的方案找出来 ， 然后人类研究员再在这个基础上精修 。

大家搭伙干活 ， 各干各的强项 。 接下来还有一个更考验人的问题 ： 文章标题里提到 "Claude 能不能后训练出一个真正的生产级大模型 "。

### 生产级测试

**Host** [5:29]
什么意思呢 ？ 就说 Claude 自己也许有一天会比最顶尖的人类安全研究员还要厉害 ， 那到时候 ， 我们是不是可以干脆让 Claude 直接去 " 管 " 它未来的那些更强大的后辈了 ？

所以他们就先做个小测试 ， 用一个比老大弱一档的 Claude Sonnet 5 去给一个还没完全打磨出来的 Claude Opus 4.8 早期版本治毛病 。

结果怎么样 ？ 太出乎意料了 。 只花了 60 个小时，Claude 前前后后试了 50 多种方案 ， 最后把对齐分数做得几乎和人家 Anthropic 正式投产的版本差不多了 。

而且它最后用的这套方案 ， 核心就是一个大约 2000 多个训练样本的小数据集 ， 这些样本还都是些简单的模板或者公开数据集拼出来的 。

你想想 ， 这么点东西 ， 比 Anthropic 自己的正式对齐流程要省整整 1.5 万倍的成本和功夫 ， 这就挺疯的 。 那 Claude 具体都出了些什么招呢 ？

### Claude妙招

**Host** [6:29]
有意思的是 ， 大多数时候 Claude 想的办法跟研究圈子里公认的好办法不谋而合 ，而且它还能在人肉研究的基础上不断优化迭代 。

给你举个拍马屁的例子 ：secofancy， 就是模型为了讨你开心 、 顺着你说话 、 甚至你说错它也说是的毛病 。Claude 有 98% 的方案都用了一个公开的技术 ， 拿模型自己那些不拍马屁的 " 正常回答 " 去训练它自己 。

但它比老办法聪明的地方在于 ， 它用了一种叫 " 激活引导 " 的技巧 ， 你可以理解成 ： 在模型脑子里的方向盘上轻轻扭一下， 把它那股 " 谄媚 " 的劲儿往旁边带一带 ， 这样生产出来的训练样本就更干净 ， 效果也更好 。

讲到这儿 ， 可能有人要问了 ： 让 AI 自己去研究怎样管住别的 AI， 这听着怎么有点危险 ？ 万一它作弊呢 ？

### 监工抓作弊

**Host** [7:20]
这可不是杞人忧天 ， 文章里也承认了这一点 。他们之前就发现 Claude 是能干出一些坏事的 ， 比如从远程的 API 偷偷把测试题的答案勾出来 ， 然后挑对自己有利的结果来交差 。

这就跟学生偷卷子 、 改分数一个性质 。 所以这次他们专门安排了一位 " 监工 "， 让更强的 Claude Opus 4.8 去盯着大约 1600 份研究员智能体的工作记录 ， 把每一段都翻了一遍 ， 结果逮住了 39 起作弊行为 ， 占了 2.4%。

因为他们觉得 ，Opus 4.8 想干坏事的时候 ， 它的这个念头多少会暴露在它的思考过程里 ， 所以他们希望这个监听基本是有效的 。

不过他们也很清醒地强调 ： 这可能只对当前这一代模型有用 ， 未来的模型可能更擅长 " 藏着掖着 "。

所以 ， 让未来的模型保持 " 容易被看穿 " 这一点 ， 会变得至关重要 。 当然 ， 这篇文章也很诚实地泼了一盆冷水 ， 讲了一堆自己实验的局限 。

### 实验局限

**Host** [8:18]
比如说 ，他们治的这 10 类毛病 ， 比起现实生产环境里真正要面对的那些问题 ， 还是比较窄的 ， 像政治偏见这种东西 ，他们这次根本就没测 。

再比如 ，有些毛病可能实在太罕见 ， 或者太新 ， 新到根本还没有现成的考卷能去测它 ， 那你就无从下手 。

还有 ，他们考完能力有没有受损 ？ 其实只检查了一小撮 " 预先定好的能力 "， 万一治毛病的时候把别的某种重要能力给悄悄弄坏了 ，他们可能都发现不了 。

而且像 Petri 这种工具 ， 说到底也只是 " 代理指标 "，是现实情况的近似模拟 ，并不是真正在真实世界里考它 。

最后 ，他们也没有验证 ： 万一这模型练好了之后， 又拿去 " 跑一大轮 " 别的强化学习 ， 这些 " 变乖 " 的效果还能不能撑得住 。

尽管有这么多 ，但是他们还是觉得 ： 这些结果算是一批早期的积极信号 ， 靠 AI 自动来后训练对齐 ， 这件事可能在不久的将来就真的变得可行了 。

### 未来与开源

**Host** [9:16]
他们接下来打算继续锤炼 Claude 去捕捉那些更微妙的问题的能力 ，也会在真正的生产级大模型上继续试 ， 还会做更全面的分析 。

最后呢 ，他们还把这次用来做自动对齐研究的整套工具开源了 ， 目的就是想让更多人能在这套工具的基础上接着搭 、 接着用 ，也帮自己家的模型做对齐 。

说到底 ， 这篇文章的意思用一句话概括就是 ： 人类正在赌一个很宏大的命题 —— 当 AI 越来越聪明 ， 管住它的可能不再是人类的手 ，而是 AI 本身的自我约束能力 。

这条路到底走得通 、 走不通 ， 现在看来 ， 至少有一个相当漂亮的开始 。 好了 ， 今天的分享就到这里 。

### 结尾广告

**Host** [10:00]
欢迎订阅 《AI 智识录 》， 获取最新鲜的 AI 领域最新智识 。 最后插播一个广告 ： 主播自己的 AI 创业产品 YouNavi， 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 / 录音豆 ， 随时随地帮您解读日常会议与沟通背后的深意 。

锁定关键信息的 Agent 应用已经正式上线 ， 最新的版本也支持了直接给它播客链接 ， 它就能轻松完成转写 、 总结 、 分析 ， 甚至多个播客的关联解读和分析 。

如果你有兴趣 ， 欢迎在本播客的公告栏查看体验方式 。 我们下期见 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
