← 回總覽

DeepSeek V4 新成果 DSpark 发布:推理速度更快

📅 2026-06-27 23:21 Datawhale 人工智能 2 分鐘 1511 字 評分: 84
投机解码 DeepSeek V4 推理加速 大语言模型 工程实践
📌 一句话摘要 深度解读 DeepSeek 与北大联合发布的 DSpark 投机解码框架,通过半自回归草稿和动态调度替换 MTP-1,使 V4 线上生成速度提升 60%–85%。 📝 详细摘要 本文系统介绍 DeepSeek V4 最新部署的投机解码框架 DSpark 及其配套训练框架 DeepSpec。文章首先梳理了投机解码的两条主流路线(自回归草稿与并行草稿)的优缺点,然后重点解读 DSpark 的两项核心创新:1)半自回归草稿:在并行骨干后添加轻量串行模块(默认 Markov head),以极低延迟(0.2%–1.3%)解决并行草稿尾部多模态碰撞问题,实测接受长度相比 Eagle3

📌 一句话摘要

深度解读 DeepSeek 与北大联合发布的 DSpark 投机解码框架,通过半自回归草稿和动态调度替换 MTP-1,使 V4 线上生成速度提升 60%–85%。

📝 详细摘要

本文系统介绍 DeepSeek V4 最新部署的投机解码框架 DSpark 及其配套训练框架 DeepSpec。文章首先梳理了投机解码的两条主流路线(自回归草稿与并行草稿)的优缺点,然后重点解读 DSpark 的两项核心创新:1)半自回归草稿:在并行骨干后添加轻量串行模块(默认 Markov head),以极低延迟(0.2%–1.3%)解决并行草稿尾部多模态碰撞问题,实测接受长度相比 Eagle3 提升 26.7%–30.9%,相比 DFlash 提升 16.3%–18.4%;2)动态验证调度:通过置信度头与 STS 校准得到可靠的存活概率,再由硬件感知调度器根据负载动态决定验证长度,避免高并发下无效验证浪费算力。生产环境数据显示,在吞吐量持平的前提下,V4-Flash 每用户生成速度提升 60%–85%,V4-Pro 提升 57%–78%。文章还指出 DSpark 的局限性——起草固定成本对复杂请求仍存在,并给出后续方向。整体是一篇信息密度高、技术原理清晰、工程落地效果扎实的深度解读。

💡 主要观点

- DSpark 通过半自回归草稿模型兼顾并行速度与自回归连贯性。 在并行骨干后添加轻量串行模块(Markov head),以极低延迟补上 token 间的顺序信息,消除并行草稿尾部多模态碰撞,接受长度全面超越现有方案。

DSpark 引入动态验证调度,根据负载裁剪无效验证。 通过置信度头与 STS 校准得到真实存活概率,硬件感知调度器在高并发时自动缩短验证长度,将算力留给排队请求,避免固定长度验证的浪费。
线上实测生成速度提升 60%–85%,吞吐与速度达到新 Pareto 前沿。 在 V4-Flash 和 V4-Pro 生产环境中,DSpark 在保持吞吐量不变的前提下,每用户生成速度显著提升;在严格延迟要求下,可利用并发容量扩展数个数量级。

💬 文章金句

- 投机解码卷了两年「草稿写得多不多、准不准」,DSpark 把矛头指向了被忽略的另一件事情:验证。

  • 并行草稿的这个缺点有个形象的例子:上下文同时支持 'of course' 和 'no problem' 两种续写,独立预测就可能拼出 'of problem' 或 'no course'。
  • 在吞吐量持平的前提下,V4-Flash 上每个用户的生成速度提升 60%–85%,V4-Pro 上提升 57%–78%。

📊 文章信息

AI 初评:84

来源:Datawhale

作者:Datawhale

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2795

标签: 投机解码, DeepSeek V4, 推理加速, 大语言模型, 工程实践

阅读完整文章

查看原文 → 發佈: 2026-06-27 23:21:00 收錄: 2026-06-28 02:00:41

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。