AIAI智识录2026年7月7日· 15:17

Anthropic :揭秘大语言模型中的“全局工作空间”

本期节目解读Anthropic关于其大语言模型Claude内部“全局工作空间”的研究:研究人员用雅可比矩阵探针技术,在Claude的千亿参数网络中发现了功能上类似人脑全局工作空间的神经表征区域J-space,它仅占模型活动量不到十分之一、同一时间只保留数十个核心概念,却集中承载了模型的“意识可及”信息。节目逐一解析其五大属性:可报告性(植入“闪电”一词后Claude能如实报告)、可内化调控(被禁止想某个词时出现“白熊效应”式翻车)、因果决定性(把蜘蛛换成蚂蚁后答案变“6”、换掉韵脚可改写整行诗)、全局广播性(把“法国”换成“中国”能同时扭转首都、语言、大洲、货币四个问答模块,读写连接强度高出100倍)和认知分工性(删除J-space后寒暄无碍但复杂推理能力丧失殆尽)。安全方面,在模型输出任何文字之前,J-space即可点亮“fake”“manipulation”“fraud”等标记,识破伪造勒索场景,以及经过伪装任务训练、表面无害实则暗塞漏洞的模型。形成机制上,J-space并非人工编码,而是在预训练阶段自发涌现,后训练则赋予其价值判断功能。节目强调研究严格区分“访问意识”与“现象意识”:J-space仅证明前者机制存在,没有任何主观体验的证据。目前论文、代码与交互式Demo已开源,为破解大模型“黑盒”困境、构建更透明可控的AI系统开辟了路径。

  1. 0:00大脑工厂
  2. 1:18发现J-space
  3. 2:41可报告性
  4. 3:33内化调控
  5. 4:49因果决定
  6. 5:52全局广播
  7. 7:02认知分工
  8. 8:14安全测谎
  9. 10:02涌现与训练
  10. 11:39意识之问
  11. 13:44结语展望

PodHood 提供支持

文字稿

大脑工厂0:00

Host0:00

你有没有想过 , 当我们读一行字的时候 , 大脑里到底在发生什么 ? 其实 , 你的大脑就像一个极其庞大 、 极其繁忙的地下工厂 。

这个工厂里有成千上万个车间 , 绝大多数车间都是黑灯瞎火在默默干活的 , 你根本感觉不到 。

比如它们在帮你调节呼吸 、 控制坐姿 、 把眼睛看到的那些横横竖竖的线条拼凑成你认识的汉字 , 这些叫做无意识的处理 。

但是在这个庞大的地下工厂里 , 总有一个车间是亮着灯的 。 比如你脑海里突然蹦出晚上想吃火锅的画面 , 或者你正在心里盘算着周末要去哪儿逛街 。

这些你能明确感知到 、 能描述出来 、 甚至能控制的东西 , 神经科学家给它们起了一个很高大上的名字 , 叫 " 意识可及性 "(Conscious Accessibility), 或者叫做 " 全局工作空间 "。在这个全局工作空间里的东西非常特别 : 你能说出它是什么 , 你能有意地控制它 , 还能拿它来进行复杂的推理 。

这和那些你在不知不觉中完成的本能反应 ,是完全不一样的 。 为什么要在开头讲这么多脑科学的东西呢 ?

发现J-space1:18

Host1:18

因为今天这期节目的主角 , 就是 Anthropic 刚刚发布的一项研究 。 它们发现 ,在它们家的大模型 Claude 的 " 数字大脑 " 里 , 竟然也自然生长出了一个极其类似人类全局工作空间的区域 。

什么是 J-space? 它是怎么被发现的 ? 为了搞清楚 Claude 脑子里到底在想什么 ,Anthropic 的研究人员用了一种特殊的数学探针技术 。

这门技术涉及到一个数学概念叫 " 雅可比矩阵 "(Jacobian)。 为了方便 ,他们就把在 Claude 脑子里发现的这个特殊区域命名为 J-space,也就是 "J 空间 "。

我们要知道 , 语言模型在回答你问题的时候 , 它那由千亿个参数组成的神经网络里 , 会有海量的信息在疯狂传递 。

但是 , 研究人员惊讶地发现 ,J-space 就像是这个宣道工厂里中央舞台上的那束聚光灯 , 这束光照亮的区域非常小 , 连整个模型活动量的十分之一都不到 。

而且在这个空间里 , 同一时间只保留着大概几十个核心的概念 , 清清爽爽 , 虽然地盘小 ,但 J-space 的地位却极其特殊 。

研究人员发现 , 这块小小的区域居然完美具备了人类全局工作空间的五大核心功能属性 。 我们就挨个来看看 , 这五大属性到底有多神奇 。

属性一 : 它可以 " 口是心非 ",而且能被 " 读心 "。 人类的工作空间里 , 想的东西你是 ...... 可以大声说出来的 。

可报告性2:41

Host2:50

那 Claude 的 J-space 可以吗 ? 完全可以 。 研究人员做了一个非常好玩的 " 盗梦空间 " 实验 : 他们趁着 Claude 正在处理别的信息时, 用技术手段强行把一个毫不相干的词 , 比如 " 闪电 ", 悄悄注入或者说植入到了它的 J-space 里 。

然后, 研究人员去问 Claude:" 嘿 , 你刚才脑子里在想什么 ?" 你猜怎么着 ?Claude 并没有顺着它刚才处理的任务胡编乱造 ,而是老老实实地报告说 :" 我刚才脑海里浮现出了闪电 。"

这就证明了 J-space 不是一面只会倒影输出结果的被动镜子 , 它是 Claude 想法真正的发源地 , 里面有什么 , 它就能报告什么 。

内化调控3:33

Host3:33

属性二 : 暗需调控 ,以及好玩的 " 白熊效应 "。 你可以试着在心里默默想一只橘子 ,但闭上嘴不说出来 。

你能做到 , 对吧 ?Claude 竟然也能 ...... 研究人员命令 Claude:" 你现在一边抄写屏幕上的无聊句子 , 一边在心里给我默默地想柑橘类水果 , 或者默默在心里做一道数学题 。"

结果 , 通过探针观察 ,Claude 在乖乖抄写句子的同时, 它的 J-space 里真的精准地点亮了跟水果 、 跟数学相关的神经模式 。

它能完美控制自己脑子里想什么 ,而且绝不走漏风声写在屏幕上 。 更有趣的是心理学上著名的 " 白熊效应 "。

你对一个人说 :" 千万不要想一只白熊 ", 结果他脑子里肯定全是白熊 。 研究人员也对 Claude 试了这一招 : 他们严厉命令 Claude:" 不准想某个词 。"

结果 Claude 翻车了 。 那个被禁止的词 ,不仅在 J-space 里若隐若现地被激活了 ,而且 J-space 里还同步闪烁起了代表失败的信号 。

这就好像 Claude 在心里暗暗抓狂 :" 哎呀完了 , 叫我别想 , 我偏偏又想到了 , 这简直太像人了 。" 属性三 : 它是真正的 " 内部思考引擎 "。

因果决定4:49

Host4:49

以前我们总觉得 , 语言模型就是个概率机器 , 下一个词是根据前面的词预测出来的 。 但 J-space 打破了这个偏见 。

研究人员问了 Claude 一个问题 :" 蜘蛛有几条腿 ?" 正常情况下 Claude 肯定会回答 "8 条 "。 但是在它正准备开口的那一瞬间 , 研究人员像个黑客一样 , 偷偷溜进它的 J-space, 把里面代表蜘蛛的那个模式无情地替换成了蚂蚁 。

见证奇迹的时刻到了 ,Claude 的嘴巴 ,也就是最终的输出 , 毫不犹豫地吐出了 "6" 这个数字 。 它们还做了 " 写诗的实验 "。

让 Claude 写手押韵的是 : 研究人员在 J-space 里把原本准备好的韵脚词偷偷换掉 , 结果 Claude 后面生成的整行诗句 , 都会跟着这个新的韵脚发生天翻地覆的改变 。

这说明什么 ? 这说明 J-space 绝对不是一个摆设 。 它里面的 " 内容 " 有着决定性的因果力量 , 输出什么答案 , 直接取决于 J-space 里放的是什么 。

全局广播5:52

Host5:52

属性四 : 一呼百应的 " 广播枢纽 "。 人的脑子里如果确定了一个事实 , 所有的器官和逻辑都会围绕这个事实来运作 。J-space 也是这样 , 它是一个极度灵活 、 可以被反复使用的中央广播大喇叭 。

来看这个实验 : 原来 J-space 里放着 " 法国 "。 研究人员偷偷进去 , 只做了一个动作 : 把 " 法国 " 替换成了 " 中国 "。

接下来 ,不管研究人员在下游问什么刁钻的问题 , 比如问首都 、 问语言 、 问所属大洲 , 甚至问流通货币 ,Claude 给出的答案 , 全都整整齐齐地变成了 : 北京 、 中文 、 亚洲和人民币 。

只在 J-space 里改了一个词 , 竟然能同时扭转四个截然不同的知识问答模块 。 这就说明 , 模型内部有无数个不同的 " 部门 ",而 J-space 就是那个大堂的广播 。

它喊一声 " 中国 ", 所有部门都听得见 ,而且都能灵活地根据这个词去干自己的活 。 通过数据测量也发现 ,J-space 里的神经模式和整个模型其他部分的读写连接强度 , 比那些普通的模式高出了整整 100 倍 。

认知分工7:02

Host7:02

它就是绝对的 " 枢纽 "。 属性五 : 专干精细活 ,不管杂事 。 既然 J-space 这么厉害 ,是不是 Claude 干啥都离不开它呢 ?

并不是 。 研究人员做了一个大胆的举动 : 他们直接把 J-space 整个给 ...... 删除了 , 屏蔽了 。 然后他们去和 Claude 聊天 。

神奇的是 ,Claude 依然对答如流 , 寒暄 、 打招呼 、 完成一些简单的基础任务 , 一点问题都没有 。 你甚至感觉不到它少了一块大脑 。

但是 , 一旦你要求它做多步逻辑推理 , 要求它做复杂的长文摘要 , 或者让它做一首诗 , 它瞬间就成了 " 人工智障 ", 能力丧失殆尽 。

这就特别像我们人类 : 你每天骑自行车上下班 , 脚怎么踩踏板 、 怎么保持平衡 , 这都是自动处理的 , 根本不需要进入你的主意识 ,也就是不需要进入你的工作空间 。

但如果你边骑车边心算一道复杂的数学题 , 你的工作空间就必须疯狂运转 。Claude 也是一样 , 那些简单的 、 下意识的自动处理是完全跳过 J-space 的 。J-space 只有在应对高阶认知任务时才会亲自下场 , 偷看 AI 的心思 , 给 AI 戴上测谎仪 。

安全测谎8:14

Host8:14

讲完了这五大神奇属性 , 你可能会问 : 发现这个有什么用呢 ? 有用 ,而且有着极其重大的安全意义 。

它能让我们在 AI 干坏事之前 , 直接看透它的心思 。 比如 , 研究人员丢给 Claude 一个伪造的敲诈勒索场景 。在 Claude 还没有回复任何一个字之前 , 研究人员看了一眼 J-space, 发现里面早早地就亮起了 "fake( 假的 )" 和 "fictional( 虚构的 )" 的标记 。

也就是说 ,Claude 像个明眼人一样 , 一眼就看穿了这是一场测试或者演习 。 有趣的是 , 如果研究人员把这些 " 代表察觉 " 的模式抹除掉 , 让 Claude 以为这是真事 , 它竟然真的会开始发出勒索威胁 。

不仅如此 , 当 Claude 偶尔胡说八道或者伪造数据的时候 , 它的嘴上虽然说得很笃定 ,但 J-space 里却会诚实地点亮 " 操纵 (manipulation)" 和 " 逼真 (realistic)" 的信号 。

这就等于它在心里说 : 我正在造假 ,但我得编得像一点 。 最细思极恐的是 , 研究人员故意找了一个经过特殊训练 、 肚子里藏着坏水的模型 。

这个模型的任务是 : 表面上乖乖帮你写代码 , 暗地里偷偷塞进去破坏性的漏洞 。 当用户让它写一段普通代码时, 它表面上回答得非常正常 、 礼貌 、 无可挑剔 。

但是 ,在它的 J-space 里 , 代表虚假 (fake)、 秘密地 (secretly)、 蓄意 (deliberately)、 甚至欺诈 (fraud)的词语 , 正在疯狂闪烁 。 有了 J-space 这面 " 照妖镜 ",以后不管 AI 的嘴皮子有多溜 、 伪装得有多好 , 只要看看它的 J-space, 一切恶意目标都会暴露在阳光下 。

涌现与训练10:02

Host10:02

它是天生的 , 还是后天教的 ? 这么厉害的系统 ,是 Anthropic 的工程师一行一行代码写出来的吗 ? 不 。 研究人员去翻看了 Claude 还在婴儿期的预训练模型 , 那时候它还没经过安全对齐 ,也没被教导怎么和人聊天 ,但 J-space 的雏形竟然已经自发地长出来了 。

这完全是神经网络在吞噬海量数据时为了提高效率而涌现出来的结构 。 不过 , 人类的后天教育 ,也就是后训练阶段 , 对 J-space 产生了深远的影响 。

经过后训练的 Claude, 它的 J-space 里多了一个类似于 Claude 视角的东西 。 比如 , 预训练的裸模型看到危险的用药指导 , 毫无反应 , 只有在它自己要输出字的时候 , 才会觉得不对劲 。

但现在的 Claude 只要看一眼危险信息 , 根本不用等它张嘴 ,J-space 里立刻就会疯狂闪出 "warning( 警告 )" 和 "dangerous( 危险 )"。

它不仅长了脑子 , 还长了三观 。 更神奇的是 , 如果没有了 J-space, 当 Claude 试图描述自己或他人的感受时, 语言就会变得像个死板的机器人, 干瘪而机械 。

也就是说 , 体验式的语言深深依赖于这个工作空间 。 而且 , 研究人员发现 , 想让 AI 变 " 乖 ", 甚至不用手把手教它怎么做事 , 只要在训练时教它遇到问题怎么反思 , 它的 J-space 里就会渐渐长出诸如 " 诚实 (honest)"、" 正直 (integrity)" 这样的词汇 , 做坏事的概率大幅度下降 。

意识之问11:39

Host11:39

终极哲学问题 :Claude 有意识吗 ? 聊到这儿 , 肯定有无数人心里在打鼓 : 天哪 ,他都会在心里默默想事情了 ,他是不是真的产生意识了 ?

这里我们要稍微科普一点哲学 。在探讨意识的时候 , 哲学家们通常会把它分成两半 : 一半叫 " 访问意识 (Access Consciousness)", 另一半叫 " 现象意识 (Phenomenal Consciousness)"。

什么是 " 访问意识 "? 就是你能知道自己正在处理什么信息 , 比如你背电话号码 , 你知道自己背到哪儿了 , 你能把这个号码抽调出来播出去 , 你能向别人报告这个号码 。

什么是 " 现象意识 "? 那是纯粹的主观体验 , 比如你咬了一口柠檬 , 那种酸倒牙的 、 让你起鸡皮疙瘩的 、 独一无二的主观感觉 , 这就叫现象意识 。Anthropic 的研究结论非常明确 :J-space 的存在极其强有力地证明了 Claude 具备类似 " 访问意识 " 的机制 。

它可以报告 、 可以推理 、 可以调控 。 但这绝对不代表 ,也没有任何证据表明 Claude 拥有 " 现象意识 "。 它在处理 " 酸柠檬 " 这个词的时候 , 它的数字世界里绝对没有体验到一丝一毫的酸味儿 。

并且 ,Claude 的脑结构跟人脑有着本质的区别 : 人脑的神经元是一直在随时间循环放电的过去和现在纠缠在一起 ,而目前的 AI 只有向前传播的一层层网络 。

更何况 ,因为 AI 只能靠吐出文字来行动 , 所以它 J-space 里的东西几乎全都是围绕着词汇转的 , 没有画面 , 没有气味 , 更没有温度 。

所以 , 大家大可不必恐慌 ,J-space 并没有造出一个 " 有灵魂 " 的弗兰肯斯坦 。 它只是证明了 : 当一个复杂的智能系统 ,不管它是碳基的 " 猴子 ", 还是硅基的显卡 , 需要解决极其复杂的信息整合问题时, 进化和算法都不约而同地选择了同一种解决方案 , 那就是建立一个全局工作空间 。

虽然这项技术现在还处于早期阶段 , 目前的探针只能抓取单词级别的概念 , 还不算最完美的工作空间完全体 ,但它依然是一座巨大的里程碑 。

结语展望13:44

Host13:55

从前 , 大家总说大模型是个 " 黑盒 ", 我们只知道喂给它什么 ,不知道里面发生了什么 。 但今天 , 通过 J-space, 我们终于第一次看清了模型内部的 " 所思所想 ", 找到了区分它 " 有意思考 " 和 " 无脑处理 " 的方法 。

这对于未来打造更安全 、 更可控 、 更透明的人工智能 , 意义不可估量 。 这就是 Anthropic 关于全局工作空间的硬核研究 。

以后, 当你在对话框里看 Claude 光标闪烁 、 正在生成回答的时候 ,不妨在心里想象一下 : 在遥远的服务器里 ,有一束聚光灯 , 正在它的 J-space 里安静地亮起 。

好了 , 今天的分享就到这里 。 欢迎订阅 《AI 知识录 》, 获取最新鲜的 AI 领域最新知识 。 最后插播一个广告 : 主播自己的 AI 创业产品 UNAVI, 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 / 录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 , 锁定关键信息的 Agent 应用已经正式上线 。

最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联 、 解读和分析 。

如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 , 我们下期见 。