参数不是唯一旋钮:智谱唐杰谈 GLM-5.3 与Scaling Law的演进
2026年8月19日 · 4:53
智谱创始人唐杰借 GLM-5.3 发布撰文阐述其对 Scaling Law 的最新理解,本集核心论点是:大模型能力提升早已不是单纯堆参数,GLM-5.3 沿用总参数 753B、激活 40B 的框架,仅用 1 个月扩展长时程环境与强化学习便实现代码能力大幅跃升,证明 Scaling Law 存在多个独立旋钮。文章回顾了 Scaling Law 的演进:Kaplan 2020 年拟合出的 27:1 配比导致 GPT-3、Gopher、MT-NLG 那一代万亿参数模型算力严重错配;Hoffman 2022 年在 400 个模型上确立每参数约 20 个 token 的计算最优配比;当推理成本主导全生命周期成本后,业界转向刻意"过度训练",LLaMA 和 Gemma 的每参数 token 数分别约 290 和 889。进入 MoE 时代,总参数决定模型能装下多少知识与事实,激活参数与有效深度决定因果推理能走多远;Roberts 2025 进一步发现最优配比因任务而异,记忆类偏爱更多参数,推理类偏爱更多数据。结论是找漏洞靠思考力而非记忆力,堆总参数堆不出绕 20 个弯的推理能力;后训练是当下余量最大的旋钮,但基础模型、预训练数据、有效深度等旋钮仍摆在桌上,Scaling 远未结束。