Google 发布第八代自研 AI 芯片 TPU,将训练与推理拆分为 TPU 8t 和 TPU 8i,以适应 Agent 时代对低延迟和高性价比的新需求。
📝 详细摘要
Google 发布第八代 TPU,核心变化是将传统“一颗芯片全包”的设计拆成两颗:TPU 8t 专注训练,支持万亿参数级预训练,单组 9600 颗可达 121 exaflops 算力、2 PB 共享内存,峰值性能为上代 3 倍;TPU 8i 专注推理,针对通信密集的后训练与实时推理场景,可将延迟至多降低一半。作者认为,这种拆分源于 AI 进入 Agent 时代后,多轮交互对单次响应延迟极为敏感。被引用的 Google Cloud 官方推文还提到,TPU 8i/8t 在低延迟服务场景可实现最高 80% 的性能/美元提升,并可扩展至 100 万+芯片。
📊 文章信息
AI 初评:80
来源:小互(@imxiaohu)
作者:小互
分类:人工智能
语言:中文
阅读时间:2 分钟
字数:366
标签: Google TPU, AI 硬件, AI 基础设施, 模型训练, 推理优化