DeepSeek:最新DSpark论文解读
2026年6月30日 · 12:26
本期解读DeepSeek联合北京大学发表的DSpark论文:一套基于置信度调度推测解码与半自回归生成的框架,在真实部署中使单用户生成速度提升60%—85%,高并发场景下系统有效吞吐量提升4倍,两层DSpark即可匹敌此前五层架构。节目先剖析大模型推理瓶颈不在浮点算力而在显存带宽,推测解码虽以草稿模型猜加大模型验证的方式提速,却存在两大结构性困境——并行草稿越靠后token接受率衰减严重、固定长度草稿验证浪费算力。DSpark的应对是半自回归架构:在并行骨干上叠加极轻量的马尔可夫头,仅依赖前一个token重标定概率,经低秩分解将额外开销压缩至0.2%—1.3%,草稿有效接受长度最高提升30%。其次是置信度调度验证:草稿模型输出每个token的存活概率,硬件感知前缀调度器依据GPU吞吐曲线动态裁定验证范围并对低置信token早停,配合在线草稿器校准把预期校准误差从8%压至约1%。实验显示相比Eagle3平均接受长度提升近30%,相比DFlash提升16%—18%;DeepSeek已将含Eagle3、DFlash与DSpark的DeepSpec全栈训练库开源。