AIAI智识录2026年8月19日· 4:53

参数不是唯一旋钮:智谱唐杰谈 GLM-5.3 与Scaling Law的演进

智谱创始人唐杰借 GLM-5.3 发布撰文阐述其对 Scaling Law 的最新理解,本集核心论点是:大模型能力提升早已不是单纯堆参数,GLM-5.3 沿用总参数 753B、激活 40B 的框架,仅用 1 个月扩展长时程环境与强化学习便实现代码能力大幅跃升,证明 Scaling Law 存在多个独立旋钮。文章回顾了 Scaling Law 的演进:Kaplan 2020 年拟合出的 27:1 配比导致 GPT-3、Gopher、MT-NLG 那一代万亿参数模型算力严重错配;Hoffman 2022 年在 400 个模型上确立每参数约 20 个 token 的计算最优配比;当推理成本主导全生命周期成本后,业界转向刻意"过度训练",LLaMA 和 Gemma 的每参数 token 数分别约 290 和 889。进入 MoE 时代,总参数决定模型能装下多少知识与事实,激活参数与有效深度决定因果推理能走多远;Roberts 2025 进一步发现最优配比因任务而异,记忆类偏爱更多参数,推理类偏爱更多数据。结论是找漏洞靠思考力而非记忆力,堆总参数堆不出绕 20 个弯的推理能力;后训练是当下余量最大的旋钮,但基础模型、预训练数据、有效深度等旋钮仍摆在桌上,Scaling 远未结束。

文字稿

开场引入0:00

Host0:00

随着 GLM5.3 的发布 , 业界在惊艳于其代码能力大幅跃升的同时 ,也好奇智谱为何没有跟其他前沿模型一样扩大基模参数量 ,而是依然沿用了总参数 753B、 激活 40B 的模型框架进行后训练扩展 。

对此 , 创始人唐杰今天在 X 上发布长文 , 系统阐述了对 Scaling Law 的最新理解 : 大模型的演进早已不是单纯堆叠参数的数字游戏 。

参数之问0:26

Host0:26

以下是原文关于 Scaling Law 的一些思考 :Scaling,但 Scaling 的不只是参数 , 如今每次模型发布最后都逃不开同一个问题 —— 多少参数 。

但这个问题无法独立回答 , 参数数量只有和其他三个问题放在一起才有意义 : 你有多少数据 、 打算把算力花在哪里 ,以及模型由谁在什么条件下运行 。

Kaplan 教训0:46

Host0:46

这一课 , 业界是付出代价才学会的 。 Kaplan 等人 2020 拟合出一个指数 , 大约是 27:1, 告诉所有人参数应该比数据增长得更快 。

业界照做了 ,GPT-3、Gopher、MT-NLG 皆是如此 。 Hoffman 等人 2022 在 400 个模型上重做了实验 , 发现计算最优的配比更接近每参数对应 20 个 token,而且在算力充足的情况下, 两者应该以相同的速率同步增长 ,而不是渐行渐远 。

早期拟合中的误差会随着算力每提升一个数量级而不断放大 , 这正是那一代最大的模型算力错配最严重的原因 。

Chinchilla 平衡1:27

Host1:27

回过头看 , 万亿参数那一轮 ,是整个行业一起走过又一起折返的一段弯路 。Chinchilla 也不是终点 , 它优化的是训练算力 : 试用对象是训练一次 、 然后拿去评测的模型 ,而今天的模型每天被调用数十亿次 , 推理成本主导了全生命周期的成本 。

把推理成本放进目标函数 , 最优解就一向更小的模型 , 训练更久 ,也就是刻意的过度训练 。LLaMA 27B 和 Gemma 29B 正是这么做的 , 它们的每参数的 token 数分别约为 290 和 889, 模型架构的稀疏化让目标再次变化 。

MoE 解耦2:05

Host2:05

在 MoE 模型里 , 必须把两个量区分开 : 总参数大致决定了模型能装下多少 " 知识 "、" 事实 "、" 长尾内容 ",而激活参数和有效深度大致决定了它能想多远 : 在链条崩断之前它能承载因果链上的多少步 。

任务配比2:21

Host2:21

稠密模型的 20:1 配比不能直接迁移 ,而且这个配比压根不是一个单一数字 。Roberts 等人 2025 发现 , 最优的每参数 token 数取决于任务 : 记忆类任务偏爱更多参数 , 推理类任务偏爱更多数据 。

推理力2:36

Host2:36

后续的 MoE 研究还观察到 ,在 TPP 每参数 token 数固定的情况下, 把总参数推得更高反而会削弱推理 ,而激活更多专家则能稳定地改善推理 。

这对我们的方向很重要 : 找漏洞靠的不是记忆力 ,而是思考力 。 记住再多的已知漏洞也没用 , 那只是知道得多 。

真正值钱的是 : 一个推理要绕 20 个弯 , 你能一个弯都不落 , 一路推到底 ,而这恰恰是 " 堆总参数堆不出来 " 的能力 。

这就要说到本次 GLM5.3 发布了 , 总参数的重要性似乎应该止步于某个阈值 , 足够装下世界即可 。 超过之后, 额外的能力来自其他维度的 Scaling: 每次前项传播的有效深度 ,以及最重要的 —— 后训练 。GLM5.3 就是我们针对这一论断所做的受控实验 。

受控实验3:06

Host3:26

与 GLM5.2 相比 , 基础模型相同 、 架构相同 、 总参数和激活参数相同 , 只用了 1 个月的时间去扩展长时程环境和强化学习 , 收获很大 。

旋钮选择3:38

Host3:38

其实 ,Scaling 不止一个旋钮 。 这次我们转动的是 " 后训练 " 这个旋钮 ,因为它留下的余地最大 。 不是因为其他旋钮已经到头了 , 基础模型 、 规模 、 预训练数据 、 每次前项传播消耗的算力 , 这些都还摆在桌上, 我们会逐一回来处理 。

下一步3:56

Host3:56

这个实验教会我们的是 : 旋钮不必一起转动 ,而且下一个值得转动的旋钮 , 往往不是 " 上一个值得转动的那个 "。

我们的 Scaling 远未结束 , 下一次也许是中训练 、 预训练 , 甚至更多 。 好了 , 这就是今天跟大家分享的全部内容 。

结尾与广告4:15

Host4:15

欢迎订阅 《AI 智识录 》, 获取最新鲜的 AI 领域最新智识 。 最后插播一个广告 : 主播自己的 AI 创业产品 Unavi, 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 / 录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 。

锁定关键信息的 Agent 应用已经正式上线 , 最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联解读和分析 。

如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 。 我们下期见 。