本文解读 DeepSeek 开源的 DSpark 推测解码框架,介绍其半自回归生成、置信度调度验证两大组件,以及在线部署中吞吐量提升 60%–85%的效果。
📝 详细摘要
文章详细解读 DeepSeek 最新开源的 DSpark 推测解码技术论文。首先指出推测解码的核心矛盾在于 draft 模型设计:自回归架构 draft 质量高但延迟随块长度增长,并行架构延迟低但后缀衰减严重。DSpark 通过半自回归生成(并行 backbone + 轻量串行 head)保留并行延迟优势并缓解后缀衰减,同时引入置信度调度验证,用 confidence head 预测每个 draft 位置的接受概率,再由硬件感知调度器根据负载动态决定验证长度,避免无效计算。训练目标组合交叉熵、分布匹配和置信度损失,按位置加权。离线实验在多个模型上相比 Eagle3 和 DFlash 提升平均接受长度 16%–31%。生产部署于 DeepSeek-V4,在相同 SLA 下 per-user 速度提升 60%–85%,并展现负载自适应特性。
💡 主要观点
- DSpark 提出半自回归生成方法,融合并行延迟优势与自回归预测质量。 并行 backbone 一次前向生成所有候选 token 的 base logits,轻量串行 head(如 Markov head)为每个位置注入前缀依赖,在 O(1)延迟开销下显著缓解后缀衰减,实验显示 2 层 DSpark 超越 5 层并行 draft 模型。
💬 文章金句
- DSpark 继承了并行的首 token 优势(Math 上 0.93 vs Eagle3 的 0.81),同时通过后缀的串行修正将衰减压到最低,实现了'两全其美'。
- DSpark 将系统的吞吐量--交互性帕累托前沿整体向外推移。
📊 文章信息
AI 初评:79
来源:PaperAgent
作者:PaperAgent
分类:人工智能
语言:中文
阅读时间:13 分钟
字数:3164
标签: LLM推理优化, 推测解码, 模型部署, DeepSeek, 开源模型