无问芯穹提出跨集群异构推理架构 PDD,通过 RelayDecode 中继掩盖 KV Cache 传输延迟,实现首 Token 延迟降低 51.5%、单 Token 成本下降 37.5%。
📝 详细摘要
文章围绕无问芯穹在 2026 WAIC 首次公布的 PDD(Prefill-RelayDecode-MainDecode)架构展开。首先指出大模型推理中 Prefill 与 Decode 对硬件需求极度分离,导致传统同构集群资源利用率低;接着通过三个关键洞察——硬件极度“偏科”、前缀缓存(DRC)可将跨集群带宽需求降低 10 倍、以及智能体工作负载下的非均匀延迟——说明为何 KV Cache 的跨集群传输延迟成为瓶颈。基于这些洞察,文章详细阐述了 PDD 三层架构的工作原理:P 实例负责 Prefill,RLD 实例通过高速 RDMA 快速获取 KV Cache 并立即开始解码以掩盖以太网延迟,MD 实例在远端集群完成后续解码;核心机制是“Extend‑Decode Handoff”,即仅传输 Token ID 由 MD 端重新计算 KV Cache,大幅降低网络开销并确保确定性延迟。文章进一步描述了流水线编排策略(P‑MD 与 P‑RLD‑MD),使得 RLD 仅承担极少数低命中率请求的延迟掩盖任务,负载仅占系统 6.2%。最后给出在 DeepSeek‑V4‑pro 模型上的实测结果:相比传统跨集群 PD 分离,PDD 使 P90 TTFT 降低约 46%(18.3 s → 9.8 s),在相近成本下有效吞吐提升 27.8%,性价比(BCR)提升高达 37.5%。文章最后展望了该架构对未来 Model‑as‑a‑Service 基础设施的意义,强调极简局部异构 + 灵活远端分离可最大化释放存量算力。
💡 主要观点
- PDD 架构通过 RelayDecode 中继掩盖跨集群 KV Cache 传输延迟。 P 实例完成 Prefill 后,通过高速 RDMA 将 KV Cache 瞬间传给同机房的 RLD 实例并立即开始解码,用户即可看到输出;与此同时,以太网缓慢将完整 KV Cache 传给远端 MD 实例,待其准备好后无缝接管后续解码,从而将网络延迟掩盖在 RLD 的先行输出阶段。
💬 文章金句
- 在让'偏科'的硬件能够只刷自己最擅长的题的同时,更突破性解决了以太网环境下 KV Cache 的传输延迟痛点。
- 其做法是:RLD 绝对不传庞大的 KV Cache,它只把生成的「Token ID」传给 MD。
- 在严格的 TTFT 约束下(P90 TTFT
📊 文章信息
AI 初评:83
来源:GitHubDaily
作者:GitHubDaily
分类:人工智能
语言:中文
阅读时间:24 分钟
字数:5801
标签: 大模型推理, 异构架构, KV Cache, 前缀缓存, Extend‑Decode Handoff