DeepSeek 联合北大发布 DSpark 推理加速框架,通过半自回归草稿模型与置信度调度验证,在线上将单用户生成速度提升 57%-85%。
📝 详细摘要
文章介绍 DeepSeek 与北京大学联合发布的推理加速框架 DSpark。现有推测解码方案存在自回归草稿模型生成慢、并行草稿模型后缀衰减等问题。DSpark 采用半自回归架构,用并行主干快速铺开候选,再以轻量级顺序模块(如 Markov head)保持连贯性;同时引入置信度调度验证,根据系统负载和候选 token 的置信度动态决定验证长度,避免低价值 token 浪费批处理容量。离线实验在 Qwen3/Gemma4 上显示,DSpark 在接受长度上领先 Eagle3 约 30% 和 DFlash 约 18%,延迟增加极小。线上部署在 DeepSeek-V4 preview 引擎中,将单用户生成速度提升 57%-85%,系统吞吐提升 51%-52%。文章最后指出推理加速已从模型结构问题发展为系统工程问题,并赞赏 DeepSeek 开源了 DSpark 权重与训练代码库 DeepSpec。
💡 主要观点
- DSpark 用半自回归架构兼顾生成速度与候选质量。 它保留并行草稿模型的快速生成主干,在输出端加入轻量级顺序模块(如 Markov head),减少后缀衰减,在数学/代码/聊天任务上接受长度明显优于纯并行或纯自回归方案。
💬 文章金句
- 大模型推理加速已经不只是模型结构问题,也越来越是系统调度问题。
- DSpark 的意义在于,它让 multi-token draft 在真实线上流量中变得可控。
📊 文章信息
AI 初评:86
来源:爱范儿
作者:莫崇宇
分类:人工智能
语言:中文
阅读时间:17 分钟
字数:4009
标签: LLM, 模型推理与训练, AI 推理加速, 推测解码, 开源项目