快手万擎通过并行策略、PD 分离、分级 KV Cache、投机解码等全链路技术,在保持模型能力的前提下显著降低推理成本并提升吞吐。
📝 详细摘要
文章以 GLM-5.2、DeepSeek-V4 等新一代大模型为例,详细介绍了快手万擎在推理引擎 kLLM 上的全链路优化实践。包括并行策略重构(Attention 采用 Request DP、MoE 采用 EP)、Ring Attention 与分块流水、三级分级 KV Cache 及前缀树增量匹配优化、半自回归投机解码 DSpark、以及基于 SLO Load 感知、10 秒级启动和全局资源池的 PD 分离弹性调度。通过这些技术,系统在保持模型能力的同时,显著提升了 KV 容量、缓存命中率和吞吐,降低了 TTFT、TPOT 等延迟指标,并在线上环境中实现了近 99% 的服务可用性。文章兼顾理论分析与实验数据,为大模型规模化部署提供了可复用的工程方法论。
💡 主要观点
- 并行策略重构:Attention 采用 Request DP,MoE 采用 EP,有效提升 KV 容量并降低 TTFT。 通过将 Attention 按请求并行、MoE 按专家并行,避免 TP 下 cKV 重复存储,使单节点有效 KV 容量提升约 7.3 倍,平均 TTFT 下降 25%。
💬 文章金句
- 推理优化不是单纯'把模型跑快',而是在模型能力基本不损失的前提下,同时压低单位 Token 成本、提升吞吐、保障 TTFT/TPOT 等服务体验指标。
- 在图示 8 卡配置中,DP Attention 使各 GPU 分别保存不同请求的 cKV,节点有效 KV 容量由纯 TP 的 2.9M Tokens 提升至 21.2M Tokens,增长约 7.3 倍,平均 TTFT 下降 25%。
- 在相同模型、流量和 SLO 条件下,与仅使用 L1 的基线相比,完整的分级缓存与 Cache-Aware 路由使缓存命中率提升 20 个百分点,SLO 约束下吞吐提升 30%。
- OpenRouter 公开监测显示,StreamLake 的 GLM‑5.2 服务近 30 天 Provider Uptime 达到 99%+。
- 通过 SLO Load 感知两侧压力,结合 10 秒级实例启动和 P/D 全局资源池,形成动态调整 P/D 容量配比的闭环。
📊 文章信息
AI 初评:88
来源:快手技术
作者:快手技术
分类:人工智能
语言:中文
阅读时间:48 分钟
字数:11890
标签: LLM 推理优化, 大模型推理, KV Cache, 并行策略, 投机解码