← 回總覽

陈天奇新书上线:面向 ML 系统的现代 GPU 编程

📅 2026-06-27 12:30 机器之心 人工智能 1 分鐘 1092 字 評分: 80
机器学习系统 GPU编程 高性能计算 深度学习 LLM优化
📌 一句话摘要 陈天奇发布免费在线书籍《Modern GPU Programming For MLSys》,系统讲解基于 Blackwell 架构的高性能 GPU kernel 编写方法,涵盖 GEMM 和 FlashAttention 实战案例。 📝 详细摘要 本文报道了 CMU 助理教授陈天奇发布免费在线书籍《Modern GPU Programming For MLSys》的消息。文章介绍了陈天奇的学术与产业背景(TVM、XGBoost、MLC-LLM 等项目的创造者),概述了书籍的定位——聚焦大模型训练推理中的高性能 GPU kernel 编写,以 Blackwell 架构为基线,

📌 一句话摘要

陈天奇发布免费在线书籍《Modern GPU Programming For MLSys》,系统讲解基于 Blackwell 架构的高性能 GPU kernel 编写方法,涵盖 GEMM 和 FlashAttention 实战案例。

📝 详细摘要

本文报道了 CMU 助理教授陈天奇发布免费在线书籍《Modern GPU Programming For MLSys》的消息。文章介绍了陈天奇的学术与产业背景(TVM、XGBoost、MLC-LLM 等项目的创造者),概述了书籍的定位——聚焦大模型训练推理中的高性能 GPU kernel 编写,以 Blackwell 架构为基线,围绕矩阵乘法(GEMM)和 FlashAttention 展开。全书分为四部分:理解 GPU 底层模型与核心概念、TIRx DSL 介绍、从基础到 SOTA 的 GEMM 优化递进路径、FlashAttention 完整实现。文章还提及了书籍的在线地址和资料形式。

💡 主要观点

- 书籍聚焦大模型训练推理中最核心的 GPU kernel 编写。 包括注意力 kernel、低精度 GEMM、融合 MoE 层等,这是端到端性能的关键瓶颈。

全书以 Blackwell 架构为硬件基础,通过 GEMM 和 FlashAttention 作为贯穿案例。 从基础实现出发,逐步引入 TMA 异步加载、软件流水线、warp 专精化等高级优化技术,直至达到 SOTA 性能。
提供 TIRx 这一 Python DSL,让读者通过可运行代码学习硬件细节。 区别于静态伪代码,TIRx 贴近硬件底层,可精确控制内存、执行单元和调度策略,增强实操性。

📊 文章信息

AI 初评:80

来源:机器之心

作者:机器之心

分类:人工智能

语言:中文

阅读时间:7 分钟

字数:1540

标签: 机器学习系统, GPU编程, 高性能计算, 深度学习, LLM优化

阅读完整文章

查看原文 → 發佈: 2026-06-27 12:30:00 收錄: 2026-06-28 00:00:39

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。