← 回總覽

快手万擎大模型推理成本和性能优化实践

📅 2026-07-31 15:07 快手技术 人工智能 2 分鐘 1989 字 評分: 88
LLM 推理优化 大模型推理 KV Cache 并行策略 投机解码
📌 一句话摘要 快手万擎通过并行策略、PD 分离、分级 KV Cache、投机解码等全链路技术,在保持模型能力的前提下显著降低推理成本并提升吞吐。 📝 详细摘要 文章以 GLM-5.2、DeepSeek-V4 等新一代大模型为例,详细介绍了快手万擎在推理引擎 kLLM 上的全链路优化实践。包括并行策略重构(Attention 采用 Request DP、MoE 采用 EP)、Ring Attention 与分块流水、三级分级 KV Cache 及前缀树增量匹配优化、半自回归投机解码 DSpark、以及基于 SLO Load 感知、10 秒级启动和全局资源池的 PD 分离弹性调度。通过这些技

📌 一句话摘要

快手万擎通过并行策略、PD 分离、分级 KV Cache、投机解码等全链路技术,在保持模型能力的前提下显著降低推理成本并提升吞吐。

📝 详细摘要

文章以 GLM-5.2、DeepSeek-V4 等新一代大模型为例,详细介绍了快手万擎在推理引擎 kLLM 上的全链路优化实践。包括并行策略重构(Attention 采用 Request DP、MoE 采用 EP)、Ring Attention 与分块流水、三级分级 KV Cache 及前缀树增量匹配优化、半自回归投机解码 DSpark、以及基于 SLO Load 感知、10 秒级启动和全局资源池的 PD 分离弹性调度。通过这些技术,系统在保持模型能力的同时,显著提升了 KV 容量、缓存命中率和吞吐,降低了 TTFT、TPOT 等延迟指标,并在线上环境中实现了近 99% 的服务可用性。文章兼顾理论分析与实验数据,为大模型规模化部署提供了可复用的工程方法论。

💡 主要观点

- 并行策略重构:Attention 采用 Request DP,MoE 采用 EP,有效提升 KV 容量并降低 TTFT。 通过将 Attention 按请求并行、MoE 按专家并行,避免 TP 下 cKV 重复存储,使单节点有效 KV 容量提升约 7.3 倍,平均 TTFT 下降 25%。

Ring Attention 与分块流水:将同步聚合改造成分块式 Ring Attention,显著降低显存占用并提升吞吐。 在相同硬件下,Ring Attention 相比 All-Gather CP 吞吐提升 16.9%,通过 Online Softmax 保持数值等价。
分级 KV Cache 与前缀树优化:构建 L1/L2/L3 三级缓存并优化前缀匹配,使总命中率提升 20 个百分点,SLO 约束下吞吐提升 30%。 L1 GPU HBM、L2 CPU DRAM、L3 SSD/分布式存储共同提供跨实例前缀复用,前缀树增量匹配将 GPU Bubble 从 400ms 降至 30ms。
投机解码 DSpark:半自回归结构平衡草稿延迟与后缀质量,在线上场景使 TPOT 下降 15%。 DSpark 通过并行网络生成 logits 并由轻量序列模块修正,兼顾低延迟与质量,验证开销受置信调度控制。
PD 分离与弹性调度:基于 SLO Load 感知、10 秒级实例启动及全局资源池,实现 P/D 资源按需弹性伸缩,使容量生效速度提升约 60 倍。 通过预测与真实负载上界计算 SLO Load,结合快速启动与资源池,使 Prefill/Decode 侧压力可独立应对,系统整体稳定性与响应时长显著改善。

💬 文章金句

- 推理优化不是单纯'把模型跑快',而是在模型能力基本不损失的前提下,同时压低单位 Token 成本、提升吞吐、保障 TTFT/TPOT 等服务体验指标。

  • 在图示 8 卡配置中,DP Attention 使各 GPU 分别保存不同请求的 cKV,节点有效 KV 容量由纯 TP 的 2.9M Tokens 提升至 21.2M Tokens,增长约 7.3 倍,平均 TTFT 下降 25%。
  • 在相同模型、流量和 SLO 条件下,与仅使用 L1 的基线相比,完整的分级缓存与 Cache-Aware 路由使缓存命中率提升 20 个百分点,SLO 约束下吞吐提升 30%。
  • OpenRouter 公开监测显示,StreamLake 的 GLM‑5.2 服务近 30 天 Provider Uptime 达到 99%+。
  • 通过 SLO Load 感知两侧压力,结合 10 秒级实例启动和 P/D 全局资源池,形成动态调整 P/D 容量配比的闭环。

📊 文章信息

AI 初评:88

来源:快手技术

作者:快手技术

分类:人工智能

语言:中文

阅读时间:48 分钟

字数:11890

标签: LLM 推理优化, 大模型推理, KV Cache, 并行策略, 投机解码

阅读完整文章

查看原文 → 發佈: 2026-07-31 15:07:00 收錄: 2026-08-01 00:00:07

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。