← 回總覽

DeepSeeK 突然发布 DSpark,让 AI 的回答不再「挤牙膏」

📅 2026-06-28 21:32 莫崇宇 人工智能 2 分鐘 1438 字 評分: 86
LLM 模型推理与训练 AI 推理加速 推测解码 开源项目
📌 一句话摘要 DeepSeek 联合北大发布 DSpark 推理加速框架,通过半自回归草稿模型与置信度调度验证,在线上将单用户生成速度提升 57%-85%。 📝 详细摘要 文章介绍 DeepSeek 与北京大学联合发布的推理加速框架 DSpark。现有推测解码方案存在自回归草稿模型生成慢、并行草稿模型后缀衰减等问题。DSpark 采用半自回归架构,用并行主干快速铺开候选,再以轻量级顺序模块(如 Markov head)保持连贯性;同时引入置信度调度验证,根据系统负载和候选 token 的置信度动态决定验证长度,避免低价值 token 浪费批处理容量。离线实验在 Qwen3/Gemma4

📌 一句话摘要

DeepSeek 联合北大发布 DSpark 推理加速框架,通过半自回归草稿模型与置信度调度验证,在线上将单用户生成速度提升 57%-85%。

📝 详细摘要

文章介绍 DeepSeek 与北京大学联合发布的推理加速框架 DSpark。现有推测解码方案存在自回归草稿模型生成慢、并行草稿模型后缀衰减等问题。DSpark 采用半自回归架构,用并行主干快速铺开候选,再以轻量级顺序模块(如 Markov head)保持连贯性;同时引入置信度调度验证,根据系统负载和候选 token 的置信度动态决定验证长度,避免低价值 token 浪费批处理容量。离线实验在 Qwen3/Gemma4 上显示,DSpark 在接受长度上领先 Eagle3 约 30% 和 DFlash 约 18%,延迟增加极小。线上部署在 DeepSeek-V4 preview 引擎中,将单用户生成速度提升 57%-85%,系统吞吐提升 51%-52%。文章最后指出推理加速已从模型结构问题发展为系统工程问题,并赞赏 DeepSeek 开源了 DSpark 权重与训练代码库 DeepSpec。

💡 主要观点

- DSpark 用半自回归架构兼顾生成速度与候选质量。 它保留并行草稿模型的快速生成主干,在输出端加入轻量级顺序模块(如 Markov head),减少后缀衰减,在数学/代码/聊天任务上接受长度明显优于纯并行或纯自回归方案。

置信度调度验证让多 token 推测在高并发下可控。 系统为每个候选位置预测置信度,结合负载与吞吐曲线动态决定验证长度,繁忙时缩短低置信候选的验证,避免浪费 batch capacity,从而提升整体吞吐。
线上部署将单用户生成速度提升 57%-85%,系统吞吐提升 51%-52%。 在 DeepSeek-V4 preview 生产引擎中,DSpark 替代 MTP-1 方案,在严格 SLA 目标下打开原本难以达到的性能区间,名义吞吐优势可达 6 倍以上。
大模型推理加速越来越依赖系统工程调度。 DSpark 的实践表明,生成更多候选 token 不等于服务更快,还需考虑候选质量、验证预算与系统负载之间的平衡,推理优化正从纯模型结构问题转向系统协同问题。

💬 文章金句

- 大模型推理加速已经不只是模型结构问题,也越来越是系统调度问题。

  • DSpark 的意义在于,它让 multi-token draft 在真实线上流量中变得可控。

📊 文章信息

AI 初评:86

来源:爱范儿

作者:莫崇宇

分类:人工智能

语言:中文

阅读时间:17 分钟

字数:4009

标签: LLM, 模型推理与训练, AI 推理加速, 推测解码, 开源项目

阅读完整文章

查看原文 → 發佈: 2026-06-28 21:32:14 收錄: 2026-06-28 14:00:40

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。