在 AI智识录 中提及的产品。

参数不是唯一旋钮:智谱唐杰谈 GLM-5.3 与Scaling Law的演进
2026年8月19日 · 4:53
智谱创始人唐杰借 GLM-5.3 发布撰文阐述其对 Scaling Law 的最新理解,本集核心论点是:大模型能力提升早已不是单纯堆参数,GLM-5.3 沿用总参数 753B、激活 40B 的框架,仅用 1 个月扩展长时程环境与强化学习便实现代码能力大幅跃升,证明 Scaling Law 存在多个独立旋钮。文章回顾了 Scaling Law 的演进:Kaplan 2020 年拟合出的 27:1 配比导致 GPT-3、Gopher、MT-NLG 那一代万亿参数模型算力严重错配;Hoffman 2022 年在 400 个模型上确立每参数约 20 个 token 的计算最优配比;当推理成本主导全生命周期成本后,业界转向刻意"过度训练",LLaMA 和 Gemma 的每参数 token 数分别约 290 和 889。进入 MoE 时代,总参数决定模型能装下多少知识与事实,激活参数与有效深度决定因果推理能走多远;Roberts 2025 进一步发现最优配比因任务而异,记忆类偏爱更多参数,推理类偏爱更多数据。结论是找漏洞靠思考力而非记忆力,堆总参数堆不出绕 20 个弯的推理能力;后训练是当下余量最大的旋钮,但基础模型、预训练数据、有效深度等旋钮仍摆在桌上,Scaling 远未结束。

Anthropic :揭秘大语言模型中的“全局工作空间”
2026年7月7日 · 15:17
本期节目解读Anthropic关于其大语言模型Claude内部“全局工作空间”的研究:研究人员用雅可比矩阵探针技术,在Claude的千亿参数网络中发现了功能上类似人脑全局工作空间的神经表征区域J-space,它仅占模型活动量不到十分之一、同一时间只保留数十个核心概念,却集中承载了模型的“意识可及”信息。节目逐一解析其五大属性:可报告性(植入“闪电”一词后Claude能如实报告)、可内化调控(被禁止想某个词时出现“白熊效应”式翻车)、因果决定性(把蜘蛛换成蚂蚁后答案变“6”、换掉韵脚可改写整行诗)、全局广播性(把“法国”换成“中国”能同时扭转首都、语言、大洲、货币四个问答模块,读写连接强度高出100倍)和认知分工性(删除J-space后寒暄无碍但复杂推理能力丧失殆尽)。安全方面,在模型输出任何文字之前,J-space即可点亮“fake”“manipulation”“fraud”等标记,识破伪造勒索场景,以及经过伪装任务训练、表面无害实则暗塞漏洞的模型。形成机制上,J-space并非人工编码,而是在预训练阶段自发涌现,后训练则赋予其价值判断功能。节目强调研究严格区分“访问意识”与“现象意识”:J-space仅证明前者机制存在,没有任何主观体验的证据。目前论文、代码与交互式Demo已开源,为破解大模型“黑盒”困境、构建更透明可控的AI系统开辟了路径。

DeepSeek:最新DSpark论文解读
2026年6月30日 · 12:26
本期解读DeepSeek联合北京大学发表的DSpark论文:一套基于置信度调度推测解码与半自回归生成的框架,在真实部署中使单用户生成速度提升60%—85%,高并发场景下系统有效吞吐量提升4倍,两层DSpark即可匹敌此前五层架构。节目先剖析大模型推理瓶颈不在浮点算力而在显存带宽,推测解码虽以草稿模型猜加大模型验证的方式提速,却存在两大结构性困境——并行草稿越靠后token接受率衰减严重、固定长度草稿验证浪费算力。DSpark的应对是半自回归架构:在并行骨干上叠加极轻量的马尔可夫头,仅依赖前一个token重标定概率,经低秩分解将额外开销压缩至0.2%—1.3%,草稿有效接受长度最高提升30%。其次是置信度调度验证:草稿模型输出每个token的存活概率,硬件感知前缀调度器依据GPU吞吐曲线动态裁定验证范围并对低置信token早停,配合在线草稿器校准把预期校准误差从8%压至约1%。实验显示相比Eagle3平均接受长度提升近30%,相比DFlash提升16%—18%;DeepSeek已将含Eagle3、DFlash与DSpark的DeepSpec全栈训练库开源。
由 PodHood 提供支持