# 参数不是唯一旋钮：智谱唐杰谈 GLM-5.3 与Scaling Law的演进

AI智识录 · 2026-08-19

<https://ai.podhood.com/0d58bc40-6a14-48ad-897d-92ea7860f609>

智谱创始人唐杰借 GLM-5.3 发布撰文阐述其对 Scaling Law 的最新理解，本集核心论点是：大模型能力提升早已不是单纯堆参数，GLM-5.3 沿用总参数 753B、激活 40B 的框架，仅用 1 个月扩展长时程环境与强化学习便实现代码能力大幅跃升，证明 Scaling Law 存在多个独立旋钮。文章回顾了 Scaling Law 的演进：Kaplan 2020 年拟合出的 27:1 配比导致 GPT-3、Gopher、MT-NLG 那一代万亿参数模型算力严重错配；Hoffman 2022 年在 400 个模型上确立每参数约 20 个 token 的计算最优配比；当推理成本主导全生命周期成本后，业界转向刻意"过度训练"，LLaMA 和 Gemma 的每参数 token 数分别约 290 和 889。进入 MoE 时代，总参数决定模型能装下多少知识与事实，激活参数与有效深度决定因果推理能走多远；Roberts 2025 进一步发现最优配比因任务而异，记忆类偏爱更多参数，推理类偏爱更多数据。结论是找漏洞靠思考力而非记忆力，堆总参数堆不出绕 20 个弯的推理能力；后训练是当下余量最大的旋钮，但基础模型、预训练数据、有效深度等旋钮仍摆在桌上，Scaling 远未结束。

## Questions this episode answers

### 为什么 GLM-5.3 没有扩大基模参数量，而是沿用总参数 753B、激活 40B 的框架？

唐杰认为总参数只代表模型承载事实知识的容量，足够装下世界即可；真正的能力提升来自其他维度的 Scaling，如每次前向传播的有效深度和后训练。GLM-5.3 就是这一论断的受控实验：基模、架构、参数与 GLM-5.2 相同，只用 1 个月扩展长时程环境和强化学习，收获很大。

[3:06](https://ai.podhood.com/0d58bc40-6a14-48ad-897d-92ea7860f609?t=186000)

### Scaling Law 经历了哪几次关键演进？Kaplan 和 Chinchilla 各自的结论是什么？

唐杰回顾：Kaplan 等 2020 年拟合出约 27:1 的指数，主张参数比数据增长更快，导致 GPT-3、Gopher、MT-NLG 等万亿参数模型出现算力错配；Hoffman 等 2022 年在 400 个模型上发现计算最优配比接近每参数 20 个 token，且两者应同步增长；推理成本主导后，最优解转向更小模型训练更久的刻意过度训练，如 LLaMA 27B 和 Gemma 29B。

[0:46](https://ai.podhood.com/0d58bc40-6a14-48ad-897d-92ea7860f609?t=46000)

### 在 MoE 模型中，总参数和激活参数分别决定什么？

唐杰指出必须区分两个量：总参数大致决定模型能装下多少知识、事实和长尾内容；激活参数和有效深度决定它能想多远，即在链条崩断之前能承载因果链上的多少步。Roberts 等 2025 年还发现最优每参数 token 数取决于任务：记忆类任务偏爱更多参数，推理类任务偏爱更多数据。

[2:05](https://ai.podhood.com/0d58bc40-6a14-48ad-897d-92ea7860f609?t=125000)

### 为什么说找漏洞靠的是思考力而不是记忆力？

唐杰解释：记住再多已知漏洞也只是知道得多，真正值钱的是一个推理要绕 20 个弯时能一个弯都不落、一路推到底。后续 MoE 研究观察到，在每参数 token 数固定的情况下，把总参数推得更高反而会削弱推理，而激活更多专家则能稳定地改善推理。

[2:36](https://ai.podhood.com/0d58bc40-6a14-48ad-897d-92ea7860f609?t=156000)

## Key moments

- **[0:00] 开场引入**
- **[0:26] 参数之问**
- **[0:46] Kaplan 教训**
  - [0:46] Kaplan 2020 的 27:1 配比让 GPT-3、Gopher 盲目堆参数，成为行业一段算力错配的弯路
- **[1:27] Chinchilla 平衡**
  - [1:27] 推理成本主导后，LLaMA 2 7B 与 Gemma 2 9B 刻意过度训练，每参数 token 数高达 290 和 889
- **[1:47] 过度训练**
- **[2:05] MoE 解耦**
  - [2:05] MoE 时代知识与推理解耦：总参数决定装多少知识，激活参数决定能想多远
- **[2:21] 任务配比**
- **[2:36] 推理力**
  - [2:48] 找漏洞靠思考力而非记忆力：推理要绕 20 个弯一路推到底，是堆总参数堆不出来的能力
- **[3:06] 受控实验**
  - [3:06] GLM-5.3 受控实验：基模、架构、总参数 753B 与激活 40B 全部不变，仅用 1 个月扩展强化学习
- **[3:38] 旋钮选择**
  - [3:38] 智谱唐杰：Scaling 不止一个旋钮，这次转后训练因为它余地最大，其余旋钮都还摆在桌上
- **[3:56] 下一步**
  - [4:05] 旋钮不必一起转动：下一个值得转的旋钮往往不是上一个，中训练、预训练都在路上
- **[4:15] 结尾与广告**

## Topics

AGI范式演进

## Mentioned

GLM-5.2 (product), GLM-5.3 (product), Gemma (product), LLaMA (product), Unavi (product)

## Transcript

### 开场引入

**Host** [0:00]
随着 GLM5.3 的发布 ， 业界在惊艳于其代码能力大幅跃升的同时 ，也好奇智谱为何没有跟其他前沿模型一样扩大基模参数量 ，而是依然沿用了总参数 753B、 激活 40B 的模型框架进行后训练扩展 。

对此 ， 创始人唐杰今天在 X 上发布长文 ， 系统阐述了对 Scaling Law 的最新理解 ： 大模型的演进早已不是单纯堆叠参数的数字游戏 。

### 参数之问

**Host** [0:26]
以下是原文关于 Scaling Law 的一些思考 ：Scaling，但 Scaling 的不只是参数 ， 如今每次模型发布最后都逃不开同一个问题 —— 多少参数 。

但这个问题无法独立回答 ， 参数数量只有和其他三个问题放在一起才有意义 ： 你有多少数据 、 打算把算力花在哪里 ，以及模型由谁在什么条件下运行 。

### Kaplan 教训

**Host** [0:46]
这一课 ， 业界是付出代价才学会的 。 Kaplan 等人 2020 拟合出一个指数 ， 大约是 27:1， 告诉所有人参数应该比数据增长得更快 。

业界照做了 ，GPT-3、Gopher、MT-NLG 皆是如此 。 Hoffman 等人 2022 在 400 个模型上重做了实验 ， 发现计算最优的配比更接近每参数对应 20 个 token，而且在算力充足的情况下， 两者应该以相同的速率同步增长 ，而不是渐行渐远 。

早期拟合中的误差会随着算力每提升一个数量级而不断放大 ， 这正是那一代最大的模型算力错配最严重的原因 。

### Chinchilla 平衡

**Host** [1:27]
回过头看 ， 万亿参数那一轮 ，是整个行业一起走过又一起折返的一段弯路 。Chinchilla 也不是终点 ， 它优化的是训练算力 ： 试用对象是训练一次 、 然后拿去评测的模型 ，而今天的模型每天被调用数十亿次 ， 推理成本主导了全生命周期的成本 。

把推理成本放进目标函数 ， 最优解就一向更小的模型 ， 训练更久 ，也就是刻意的过度训练 。LLaMA 27B 和 Gemma 29B 正是这么做的 ， 它们的每参数的 token 数分别约为 290 和 889， 模型架构的稀疏化让目标再次变化 。

### MoE 解耦

**Host** [2:05]
在 MoE 模型里 ， 必须把两个量区分开 ： 总参数大致决定了模型能装下多少 " 知识 "、" 事实 "、" 长尾内容 "，而激活参数和有效深度大致决定了它能想多远 ： 在链条崩断之前它能承载因果链上的多少步 。

### 任务配比

**Host** [2:21]
稠密模型的 20:1 配比不能直接迁移 ，而且这个配比压根不是一个单一数字 。Roberts 等人 2025 发现 ， 最优的每参数 token 数取决于任务 ： 记忆类任务偏爱更多参数 ， 推理类任务偏爱更多数据 。

### 推理力

**Host** [2:36]
后续的 MoE 研究还观察到 ，在 TPP 每参数 token 数固定的情况下， 把总参数推得更高反而会削弱推理 ，而激活更多专家则能稳定地改善推理 。

这对我们的方向很重要 ： 找漏洞靠的不是记忆力 ，而是思考力 。 记住再多的已知漏洞也没用 ， 那只是知道得多 。

真正值钱的是 ： 一个推理要绕 20 个弯 ， 你能一个弯都不落 ， 一路推到底 ，而这恰恰是 " 堆总参数堆不出来 " 的能力 。

这就要说到本次 GLM5.3 发布了 ， 总参数的重要性似乎应该止步于某个阈值 ， 足够装下世界即可 。 超过之后， 额外的能力来自其他维度的 Scaling： 每次前项传播的有效深度 ，以及最重要的 —— 后训练 。GLM5.3 就是我们针对这一论断所做的受控实验 。

### 受控实验

**Host** [3:26]
与 GLM5.2 相比 ， 基础模型相同 、 架构相同 、 总参数和激活参数相同 ， 只用了 1 个月的时间去扩展长时程环境和强化学习 ， 收获很大 。

### 旋钮选择

**Host** [3:38]
其实 ，Scaling 不止一个旋钮 。 这次我们转动的是 " 后训练 " 这个旋钮 ，因为它留下的余地最大 。 不是因为其他旋钮已经到头了 ， 基础模型 、 规模 、 预训练数据 、 每次前项传播消耗的算力 ， 这些都还摆在桌上， 我们会逐一回来处理 。

### 下一步

**Host** [3:56]
这个实验教会我们的是 ： 旋钮不必一起转动 ，而且下一个值得转动的旋钮 ， 往往不是 " 上一个值得转动的那个 "。

我们的 Scaling 远未结束 ， 下一次也许是中训练 、 预训练 ， 甚至更多 。 好了 ， 这就是今天跟大家分享的全部内容 。

### 结尾与广告

**Host** [4:15]
欢迎订阅 《AI 智识录 》， 获取最新鲜的 AI 领域最新智识 。 最后插播一个广告 ： 主播自己的 AI 创业产品 Unavi， 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 / 录音豆 ， 随时随地帮您解读日常会议与沟通背后的深意 。

锁定关键信息的 Agent 应用已经正式上线 ， 最新的版本也支持了直接给它播客链接 ， 它就能轻松完成转写 、 总结 、 分析 ， 甚至多个播客的关联解读和分析 。

如果你有兴趣 ， 欢迎在本播客的公告栏查看体验方式 。 我们下期见 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
