← 回總覽

“接力跑”盘活全国算力,PD 分离终于破局:延迟砍半、成本直降近 40%!

📅 2026-07-30 14:14 思邈 人工智能 2 分鐘 2155 字 評分: 88
大模型推理 PDD架构 跨集群异构 KV Cache 前缀缓存
📌 一句话摘要 无问芯穹提出 PDD 架构,通过三级分离和 Token 传输重算机制,将跨集群 KV Cache 传输延迟掩盖,实现首 Token 延迟降低 51.5%、单 Token 成本降 37.5%,并提升性价比 37.5%。 📝 详细摘要 文章详细介绍了无问芯穹在 2026 WAIC 大会上首次公开的跨集群异构推理架构 PDD(Prefill‑RelayDecode‑MainDecode)。文章先从三个关键洞察切入:硬件在 Prefill 和 Decode 阶段的性能极度偏科、前缀缓存 DRC 可将跨集群带宽需求降低约 10 倍、以及 KV Cache 传输延迟仅集中在低命中率的少

📌 一句话摘要

无问芯穹提出 PDD 架构,通过三级分离和 Token 传输重算机制,将跨集群 KV Cache 传输延迟掩盖,实现首 Token 延迟降低 51.5%、单 Token 成本降 37.5%,并提升性价比 37.5%。

📝 详细摘要

文章详细介绍了无问芯穹在 2026 WAIC 大会上首次公开的跨集群异构推理架构 PDD(Prefill‑RelayDecode‑MainDecode)。文章先从三个关键洞察切入:硬件在 Prefill 和 Decode 阶段的性能极度偏科、前缀缓存 DRC 可将跨集群带宽需求降低约 10 倍、以及 KV Cache 传输延迟仅集中在低命中率的少数“刺头”请求上。基于这些洞察,PDD 在主集群部署 P 实例(Prefill)、同机房 RDMA 互联的 RLD 实例(中继解码)以及远端集群的 MD 实例(主解码),通过仅传输 Token ID 并由 MD 端重新计算 KV Cache 的 Extend‑Decode Handoff 机制,有效掩盖以太网延迟。实验在 DeepSeek‑V4‑pro 模型上显示,PDD 使 P90 TTFT 降低 46%(18.3 s→9.8 s)、P99 降低 51%(29.7 s→14.4 s),RLD 仅承担 6.2%的 Token 生成任务,总成本下降 3.5%‑7.1%而有效吞吐提升 27.8%,性价比(BCR)提升 37.5%。文章进一步指出,该架构为未来模型即服务(MaaS)提供了极简局部异构+灵活远端分离的蓝图,能够大规模盘活存量算力。

💡 主要观点

- 洞察 1:硬件性能极度偏科,Prefill 需算力强,Decode 需带宽高,促使异构分离思路。 文中以某旗舰 GPU 为例,Prefill 仅达基线 81%性能,Decode 却爆发至 210%,说明单一硬件难以同时满足两阶段需求。

洞察 2 与 3:前缀缓存 DRC 大幅降低带宽需求;KV Cache 传输延迟仅集中在低命中率请求,呈极度偏斜分布。 DRC 利用平均 90%的前缀命中率将跨集群带宽需求降低约 10 倍;实测显示只有极少数低命中率请求导致 18 秒以上长尾延迟,绝大多数请求延迟极低。
PDD 采用三级分离(P‑RLD‑MD)及 Extend‑Decode Handoff,仅传输 Token ID 实现零网络开销交接,由 MD 端重算 KV Cache。 P 实例通过 RDMA 快速将 KV Cache 发送至同机房 RLD,RLD 立即开始解码并输出 Token;同时通过以太网慢传完整 KV Cache 给 MD,MD 收到 Token ID 后在本地重算对应 KV Cache 并继续解码,实现延迟掩盖。
实验结果:PDD 使 P90 TTFT 降 46%、P99 降 51%,RLD 仅承担 6.2% Token 生成,总成本下降 3.5%-7.1%而有效吞吐提升 27.8%,性价比提升 37.5%。 在 DeepSeek‑V4‑pro 及真实 Agentic 工作负载上的测试表明,绝大多数高命中率请求直接走 P‑MD 通道,只有少数刺头请求使用 RLD,因而 RLD 负载极低,整体成本效益显著提升。

💬 文章金句

- 在让“偏科”的硬件能够只刷自己最擅长的题的同时,更突破性解决了以太网环境下 KV Cache 的传输延迟痛点。

  • 实测数据显示,该架构在实现了首 Token 延迟降低 51.5% 的同时,单 Token 成本可降低 37.5%。
  • 通过这种“只传 Token,本地重算”的方式,无问芯穹团队把一个受网络波动影响极大、不可控的操作,变成了一个确定性的、可预测的本地计算操作。
  • PDD 在总成本下降约 3.5%~7.1%的前提下,请求的有效吞吐量(RPS Goodput)反而提升了 27.8%,最终使得性价比(Benefit‑Cost Ratio,BCR)提升了高达 37.5%。
  • 未来,我们不需要在同一个机房里堆砌庞杂的异构芯片,只需要在主算力中心保留极小比例的‘接力手’,就能像云原生调度资源一样,把庞大的解码任务分发到全国乃至全球的低成本算力节点上。

📊 文章信息

AI 初评:88

来源:量子位

作者:思邈

分类:人工智能

语言:中文

阅读时间:27 分钟

字数:6615

标签: 大模型推理, PDD架构, 跨集群异构, KV Cache, 前缀缓存

阅读完整文章

查看原文 → 發佈: 2026-07-30 14:14:43 收錄: 2026-07-30 20:00:36

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。