← 回總覽

让 Token 成本爆降近 40%,这个 AI 架构有点猛...

📅 2026-07-30 17:05 GitHubDaily 人工智能 2 分鐘 2253 字 評分: 83
大模型推理 异构架构 KV Cache 前缀缓存 Extend‑Decode Handoff
📌 一句话摘要 无问芯穹提出跨集群异构推理架构 PDD,通过 RelayDecode 中继掩盖 KV Cache 传输延迟,实现首 Token 延迟降低 51.5%、单 Token 成本下降 37.5%。 📝 详细摘要 文章围绕无问芯穹在 2026 WAIC 首次公布的 PDD(Prefill-RelayDecode-MainDecode)架构展开。首先指出大模型推理中 Prefill 与 Decode 对硬件需求极度分离,导致传统同构集群资源利用率低;接着通过三个关键洞察——硬件极度“偏科”、前缀缓存(DRC)可将跨集群带宽需求降低 10 倍、以及智能体工作负载下的非均匀延迟——说明为何

📌 一句话摘要

无问芯穹提出跨集群异构推理架构 PDD,通过 RelayDecode 中继掩盖 KV Cache 传输延迟,实现首 Token 延迟降低 51.5%、单 Token 成本下降 37.5%。

📝 详细摘要

文章围绕无问芯穹在 2026 WAIC 首次公布的 PDD(Prefill-RelayDecode-MainDecode)架构展开。首先指出大模型推理中 Prefill 与 Decode 对硬件需求极度分离,导致传统同构集群资源利用率低;接着通过三个关键洞察——硬件极度“偏科”、前缀缓存(DRC)可将跨集群带宽需求降低 10 倍、以及智能体工作负载下的非均匀延迟——说明为何 KV Cache 的跨集群传输延迟成为瓶颈。基于这些洞察,文章详细阐述了 PDD 三层架构的工作原理:P 实例负责 Prefill,RLD 实例通过高速 RDMA 快速获取 KV Cache 并立即开始解码以掩盖以太网延迟,MD 实例在远端集群完成后续解码;核心机制是“Extend‑Decode Handoff”,即仅传输 Token ID 由 MD 端重新计算 KV Cache,大幅降低网络开销并确保确定性延迟。文章进一步描述了流水线编排策略(P‑MD 与 P‑RLD‑MD),使得 RLD 仅承担极少数低命中率请求的延迟掩盖任务,负载仅占系统 6.2%。最后给出在 DeepSeek‑V4‑pro 模型上的实测结果:相比传统跨集群 PD 分离,PDD 使 P90 TTFT 降低约 46%(18.3 s → 9.8 s),在相近成本下有效吞吐提升 27.8%,性价比(BCR)提升高达 37.5%。文章最后展望了该架构对未来 Model‑as‑a‑Service 基础设施的意义,强调极简局部异构 + 灵活远端分离可最大化释放存量算力。

💡 主要观点

- PDD 架构通过 RelayDecode 中继掩盖跨集群 KV Cache 传输延迟。 P 实例完成 Prefill 后,通过高速 RDMA 将 KV Cache 瞬间传给同机房的 RLD 实例并立即开始解码,用户即可看到输出;与此同时,以太网缓慢将完整 KV Cache 传给远端 MD 实例,待其准备好后无缝接管后续解码,从而将网络延迟掩盖在 RLD 的先行输出阶段。

核心机制是“Extend‑Decode Handoff”:仅传输 Token ID,由 MD 端重新计算 KV Cache。 RLD 不传输庞大的 KV Cache,只把生成的 Token ID(几 KB)发给 MD;MD 利用 Extend‑Decode 技术在本地重新计算这些 Token 对应的 KV Cache 并生成下一个 Token。由于 Decode 阶段是访存密集型、计算轻量,重算 100 个 Token 的平均延迟仅 305 ms,远低于直接以太网传输 KV Cache 的平均 185 ms 加上波动与排队延迟,因而获得确定性、低波动的延迟表现。
流水线编排使 RLD 仅承担极少数低命中率请求的延迟掩盖任务。 基于缓存命中率的极度偏斜分布(70%-80% 请求命中率 >95%),文章设计了 P‑MD 流水线处理高命中率请求(直接以太网传给 MD),仅对低命中率的“刺头请求”启用 P‑RLD‑MD 流水线。实测显示 RLD 仅占系统 Token 生成的 6.2%,而 MD 包揽 93.8% 的重负载,避免 RLD 成为瓶颈。
实测表明 PDD 在降低成本的同时显著提升性价比。 在 DeepSeek‑V4‑pro 上的实验中,相比传统跨集群 PD 分离(CDC‑PD),PDD 在总成本下降 3.5%~7.1% 的前提下,有效吞吐量(RPS Goodput)提升 27.8%,使得性价比(Benefit‑Cost Ratio,BCR)提升高达 37.5%。同时,P90 TTFT 从 18.3 s 降至 9.8 s(降幅约 46%),P99 从 29.7 s 降至 14.4 s。

💬 文章金句

- 在让'偏科'的硬件能够只刷自己最擅长的题的同时,更突破性解决了以太网环境下 KV Cache 的传输延迟痛点。

  • 其做法是:RLD 绝对不传庞大的 KV Cache,它只把生成的「Token ID」传给 MD。
  • 在严格的 TTFT 约束下(P90 TTFT

📊 文章信息

AI 初评:83

来源:GitHubDaily

作者:GitHubDaily

分类:人工智能

语言:中文

阅读时间:24 分钟

字数:5801

标签: 大模型推理, 异构架构, KV Cache, 前缀缓存, Extend‑Decode Handoff

阅读完整文章

查看原文 → 發佈: 2026-07-30 17:05:00 收錄: 2026-07-31 00:00:36

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。