本文结合专家访谈与行业数据,系统拆解 AI Infra 的四层架构,解释 GPU 利用率低下的原因,并剖析 KV Cache 复用、连续批处理、PD 分离、投机采样等关键技术如何把算力效率榨到极限。
📝 详细摘要
在推理需求爆发与 GPU 短缺并存的背景下,AI Infra 成为新的千亿级赛道。文章从谷歌、OpenAI 自研芯片的造芯大战切入,指出相比继续采购硬件,提升已部署 GPU 的利用率是更现实的方向。作者给出 AI Infra 的四层架构:能源基础设施、计算硬件、系统软件与服务编排,并用 CMU 对 756 块 GPU 的 31 天遥测数据说明 GPU 存在大量执行空转。随后围绕四个核心问题展开:哪些计算不用重做、哪些等待可消除、哪些算力没吃满、哪些资源没协同,逐一介绍了 SGLang 的 RadixAttention(KV Cache 复用、缓存感知调度与淘汰机制)、连续批处理、Prefill/Decode 分离、低精度计算、投机采样,以及面向强化学习后训练的框架 Miles。文章结合 RadixArk 团队与数据中心专家的访谈,展望 AI Infra 作为 AI 时代操作系统的角色,并认为 Infra 公共化将显著降低从事 AI 的门槛。
💡 主要观点
- GPU 看似繁忙,实际大量时间在空转等待。 CMU 对 756 块 GPU 的 31 天遥测显示,近 20% 执行时间和约 11% 能耗浪费在等待上,推理场景的空转浪费更严重。
💬 文章金句
- 所以,当 AI Infra 能力从少数前沿模型巨头的独家资源,变成任何一家创业公司都能直接调用的公共品,从事 AI 工作的门槛会被显著降低。
- 推理框架正越来越像 AI 时代的“操作系统”,成为连接模型与芯片的关键一层。
- 你以为 GPU 很忙,其实大多数时候,GPU 是很“闲”的。
- 业界现在把它称为“推理税”,这意思大概跟智商税也差不太多,反正都是白花的钱。
📊 文章信息
AI 初评:88
来源:硅谷101
作者:硅谷101
分类:人工智能
语言:中文
阅读时间:42 分钟
字数:10316
标签: AI Infra, 模型训练与推理, LLM, GPU, 推理引擎