← 回總覽

重磅!DeepSeek 开源最新 DSpark 技术论文

📅 2026-06-29 08:33 PaperAgent 人工智能 2 分鐘 1596 字 評分: 79
LLM推理优化 推测解码 模型部署 DeepSeek 开源模型
📌 一句话摘要 本文解读 DeepSeek 开源的 DSpark 推测解码框架,介绍其半自回归生成、置信度调度验证两大组件,以及在线部署中吞吐量提升 60%–85%的效果。 📝 详细摘要 文章详细解读 DeepSeek 最新开源的 DSpark 推测解码技术论文。首先指出推测解码的核心矛盾在于 draft 模型设计:自回归架构 draft 质量高但延迟随块长度增长,并行架构延迟低但后缀衰减严重。DSpark 通过半自回归生成(并行 backbone + 轻量串行 head)保留并行延迟优势并缓解后缀衰减,同时引入置信度调度验证,用 confidence head 预测每个 draft 位置

📌 一句话摘要

本文解读 DeepSeek 开源的 DSpark 推测解码框架,介绍其半自回归生成、置信度调度验证两大组件,以及在线部署中吞吐量提升 60%–85%的效果。

📝 详细摘要

文章详细解读 DeepSeek 最新开源的 DSpark 推测解码技术论文。首先指出推测解码的核心矛盾在于 draft 模型设计:自回归架构 draft 质量高但延迟随块长度增长,并行架构延迟低但后缀衰减严重。DSpark 通过半自回归生成(并行 backbone + 轻量串行 head)保留并行延迟优势并缓解后缀衰减,同时引入置信度调度验证,用 confidence head 预测每个 draft 位置的接受概率,再由硬件感知调度器根据负载动态决定验证长度,避免无效计算。训练目标组合交叉熵、分布匹配和置信度损失,按位置加权。离线实验在多个模型上相比 Eagle3 和 DFlash 提升平均接受长度 16%–31%。生产部署于 DeepSeek-V4,在相同 SLA 下 per-user 速度提升 60%–85%,并展现负载自适应特性。

💡 主要观点

- DSpark 提出半自回归生成方法,融合并行延迟优势与自回归预测质量。 并行 backbone 一次前向生成所有候选 token 的 base logits,轻量串行 head(如 Markov head)为每个位置注入前缀依赖,在 O(1)延迟开销下显著缓解后缀衰减,实验显示 2 层 DSpark 超越 5 层并行 draft 模型。

置信度调度验证根据负载动态调整验证预算,最大化全局吞吐量。 confidence head 预测每个 draft token 的条件接受概率,经 STS 校准后由硬件感知调度器按生存概率贪心选择验证长度;轻负载时扩展验证块长,高负载时收缩以保护 batch 容量。
DSpark 在 DeepSeek-V4 生产环境中实现吞吐量与交互性的帕累托前沿外推。 以 MTP-1 为基线,V4-Flash 在 80 tok/s/user SLA 下总吞吐量提升 51%,per-user 速度提升 60%–85%;V4-Pro 对应提升 52%和 57%–78%。
位置级分析揭示了 DSpark 同时继承并行模型高首 token 容量和自回归模型后缀稳定性的优势。 并行模型首位置接受率高但快速衰减,自回归模型随位置上升而提升;DSpark 首位置接近并行,后缀通过串行修正将衰减压到最低,实现两全其美。

💬 文章金句

- DSpark 继承了并行的首 token 优势(Math 上 0.93 vs Eagle3 的 0.81),同时通过后缀的串行修正将衰减压到最低,实现了'两全其美'。

  • DSpark 将系统的吞吐量--交互性帕累托前沿整体向外推移。

📊 文章信息

AI 初评:79

来源:PaperAgent

作者:PaperAgent

分类:人工智能

语言:中文

阅读时间:13 分钟

字数:3164

标签: LLM推理优化, 推测解码, 模型部署, DeepSeek, 开源模型

阅读完整文章

查看原文 → 發佈: 2026-06-29 08:33:00 收錄: 2026-06-29 22:00:50

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。