深度解读 DeepSeek 与北大联合发布的 DSpark 投机解码框架,通过半自回归草稿和动态调度替换 MTP-1,使 V4 线上生成速度提升 60%–85%。
📝 详细摘要
本文系统介绍 DeepSeek V4 最新部署的投机解码框架 DSpark 及其配套训练框架 DeepSpec。文章首先梳理了投机解码的两条主流路线(自回归草稿与并行草稿)的优缺点,然后重点解读 DSpark 的两项核心创新:1)半自回归草稿:在并行骨干后添加轻量串行模块(默认 Markov head),以极低延迟(0.2%–1.3%)解决并行草稿尾部多模态碰撞问题,实测接受长度相比 Eagle3 提升 26.7%–30.9%,相比 DFlash 提升 16.3%–18.4%;2)动态验证调度:通过置信度头与 STS 校准得到可靠的存活概率,再由硬件感知调度器根据负载动态决定验证长度,避免高并发下无效验证浪费算力。生产环境数据显示,在吞吐量持平的前提下,V4-Flash 每用户生成速度提升 60%–85%,V4-Pro 提升 57%–78%。文章还指出 DSpark 的局限性——起草固定成本对复杂请求仍存在,并给出后续方向。整体是一篇信息密度高、技术原理清晰、工程落地效果扎实的深度解读。
💡 主要观点
- DSpark 通过半自回归草稿模型兼顾并行速度与自回归连贯性。 在并行骨干后添加轻量串行模块(Markov head),以极低延迟补上 token 间的顺序信息,消除并行草稿尾部多模态碰撞,接受长度全面超越现有方案。
💬 文章金句
- 投机解码卷了两年「草稿写得多不多、准不准」,DSpark 把矛头指向了被忽略的另一件事情:验证。
- 并行草稿的这个缺点有个形象的例子:上下文同时支持 'of course' 和 'no problem' 两种续写,独立预测就可能拼出 'of problem' 或 'no course'。
- 在吞吐量持平的前提下,V4-Flash 上每个用户的生成速度提升 60%–85%,V4-Pro 上提升 57%–78%。
📊 文章信息
AI 初评:84
来源:Datawhale
作者:Datawhale
分类:人工智能
语言:中文
阅读时间:12 分钟
字数:2795
标签: 投机解码, DeepSeek V4, 推理加速, 大语言模型, 工程实践