无问芯穹提出 PDD 架构,通过三级分离和 Token 传输重算机制,将跨集群 KV Cache 传输延迟掩盖,实现首 Token 延迟降低 51.5%、单 Token 成本降 37.5%,并提升性价比 37.5%。
📝 详细摘要
文章详细介绍了无问芯穹在 2026 WAIC 大会上首次公开的跨集群异构推理架构 PDD(Prefill‑RelayDecode‑MainDecode)。文章先从三个关键洞察切入:硬件在 Prefill 和 Decode 阶段的性能极度偏科、前缀缓存 DRC 可将跨集群带宽需求降低约 10 倍、以及 KV Cache 传输延迟仅集中在低命中率的少数“刺头”请求上。基于这些洞察,PDD 在主集群部署 P 实例(Prefill)、同机房 RDMA 互联的 RLD 实例(中继解码)以及远端集群的 MD 实例(主解码),通过仅传输 Token ID 并由 MD 端重新计算 KV Cache 的 Extend‑Decode Handoff 机制,有效掩盖以太网延迟。实验在 DeepSeek‑V4‑pro 模型上显示,PDD 使 P90 TTFT 降低 46%(18.3 s→9.8 s)、P99 降低 51%(29.7 s→14.4 s),RLD 仅承担 6.2%的 Token 生成任务,总成本下降 3.5%‑7.1%而有效吞吐提升 27.8%,性价比(BCR)提升 37.5%。文章进一步指出,该架构为未来模型即服务(MaaS)提供了极简局部异构+灵活远端分离的蓝图,能够大规模盘活存量算力。
💡 主要观点
- 洞察 1:硬件性能极度偏科,Prefill 需算力强,Decode 需带宽高,促使异构分离思路。 文中以某旗舰 GPU 为例,Prefill 仅达基线 81%性能,Decode 却爆发至 210%,说明单一硬件难以同时满足两阶段需求。
💬 文章金句
- 在让“偏科”的硬件能够只刷自己最擅长的题的同时,更突破性解决了以太网环境下 KV Cache 的传输延迟痛点。
- 实测数据显示,该架构在实现了首 Token 延迟降低 51.5% 的同时,单 Token 成本可降低 37.5%。
- 通过这种“只传 Token,本地重算”的方式,无问芯穹团队把一个受网络波动影响极大、不可控的操作,变成了一个确定性的、可预测的本地计算操作。
- PDD 在总成本下降约 3.5%~7.1%的前提下,请求的有效吞吐量(RPS Goodput)反而提升了 27.8%,最终使得性价比(Benefit‑Cost Ratio,BCR)提升了高达 37.5%。
- 未来,我们不需要在同一个机房里堆砌庞杂的异构芯片,只需要在主算力中心保留极小比例的‘接力手’,就能像云原生调度资源一样,把庞大的解码任务分发到全国乃至全球的低成本算力节点上。
📊 文章信息
AI 初评:88
来源:量子位
作者:思邈
分类:人工智能
语言:中文
阅读时间:27 分钟
字数:6615
标签: 大模型推理, PDD架构, 跨集群异构, KV Cache, 前缀缓存