← 回總覽

Modal CTO:你的 AI 应用不该跑在 K8s 上,Agent 时代的云应该长什么样

📅 2026-07-09 09:46 跨国串门儿计划 人工智能 7 分鐘 8677 字 評分: 90
AI 基础设施 Kubernetes 自供应运行时 Agent 体验 弹性推理
📌 一句话摘要 Modal CTO Akshat Bubna 深度解析为何 Kubernetes 等传统云架构不适应突发性、算力密集型的 AI 工作负载,并分享了用“自供应运行时”和“代码即配置”理念为 AI Agent 重新设计云平台的实战经验。 📝 详细摘要 本期播客深度探讨了专为 AI 工作负载设计的云平台 Modal 的技术哲学与产品实践。联合创始人兼 CTO Akshat Bubna 详细阐述了传统云架构,尤其是 Kubernetes,在处理 AI 推理与训练时面临的本质矛盾:它们是为中心化的、常驻型 Web 服务设计的,扩缩容缓慢,而 AI 负载是去中心化、突发性的。他强调 A

PODCAST

90

Modal CTO Akshat Bubna deeply analyzes why traditional cloud architectures like Kubernetes are ill-suited for bursty, compute-intensive AI workloads, and shares hands-on experience in redesigning cloud platforms for AI Agents using the concepts of 'self-provisioning runtime' and 'code as configuration.' ![Image 1: #620 Modal CTO: Your AI App Shouldn't Run on K8s – What Should the Cloud Look Like in the Agent Era?跨国串门儿计划](https://www.bestblogs.dev/podcasts?sourceid=938310 "View More From This Source")

Today 52:04 13 chapters View Source →

!Image 2: #620 Modal CTO: Your AI App Shouldn't Run on K8s – What Should the Cloud Look Like in the Agent Era?

00:00 00:00

CH.1 AI 基础设施演变:从开发者体验到 Agent 体验的转变 00:00 — 02:26

00:00 1

欢迎收听跨国串门计划,这是一档专注于让中文听众无障碍欣赏全球优质外语播客的节目。通过先进的 AI 声纹克隆技术,我们不仅将内容翻译成中文,还完美保留了原主持人和嘉宾的独特声音,为您呈现全球顶尖的 AI 财经健康与科技领域精品内容。我是主播一凯,一位热衷于 AI 领域的产品经理,很荣幸能为您搭建这座跨越语言障碍的桥梁。接下来让我为您简单介绍本期我们克隆的这档节目。本期我们克隆的是知名 AI 工程播客 latent space 在 2026 年 7 月的一期深度对谈。主持人 swiss 和 vivo 与嘉宾 AK chat barba 展开交流。AK shut 是云平台 model 的 CTO,这家公司刚完成 C 轮融资,正从开发者体验转向 agent 体验,为很多前沿 AI 公司提供弹性推理和沙箱等底层能力。这一期他们主要围绕 AI 基础设施的演变展开,聊到了为什么传统云架构不适合突发性的 AI 工作负载,以及 model 在推理训练和 agent 沙箱方面的技术思路。那我们就一起来听听这期的完整对话。

01:15 2

我们其实已经把 SK 团队的方向从开发者体验转向了 agent 体验。而且我们认为那些对开发者体验有好处的点对 agent 体验同样适用。就是说你为什么要让一个 agent 去读几百个 cube ladies 文件,写那种连类型都没有的阴谋呢?他明明只需要改几个装饰器里的参数,就能得到一个自供应的,运行时直接看到自己的改动,实时生效。

01:43 2

在进入今天的正题之前,我想对听众说几句,谢谢你们。如果你们没有选择点进来收听我们的内容,我们就没法给大家带来你们这么想听的 AI 工程科学和娱乐内容。几乎每天都有人来找我们谈赞助,但好在有过多的朋友真的订阅了我们,让我们能在没有广告的情况下持续做下去。我们也想保持这样,但我有个小请求想拜托大家,你们能做的最有力也完全免费的一件事就是点一下那个订阅按钮。这是我唯一想请大家做的事儿,对我和我的团队来说意义重大。我们每周都拼尽全力把 latent space 带给你们。如果你们点了,我保证我们会一直努力把节目做得更好。

Click any line to jump · Hover to ask AI

Content Overview

Model 公司通过创新技术,如 GPU 推理、自动化研究、多节点训练等,简化复杂技术并集成到平台中,提供用户友好型解决方案。其软件层差异化优势,专注于高效、透明、可扩展性和高性能,支持从简易操作到高级模型调整。Model 在 GPU 与 CPU 协同、网络架构优化、以及 Agent 底层能力构建方面展现前瞻性,致力于成为连接基础实验室与企业用户的桥梁,推动 AI 技术广泛应用。公司还从开发者体验转向 Agent 体验,提供弹性推理和沙箱能力,通过开源技术与客户合作,推动 AI 应用快速迭代和优化。未来,Model 将探索多模态处理、视频生成及计算生物学等领域的突破,引领 AI 基础设施发展。

#### Speaker Summaries

发言人1

介绍了“跨国串门计划”这档节目,利用 AI 声纹克隆技术为中文听众提供无障碍欣赏全球优质外语播客的体验,特别保留原主持人和嘉宾的声音特色。作为热衷于 AI 领域的主播,他重点介绍了本期克隆的知名 AI 工程播客“latent space”的深度对谈,讨论了 AI 基础设施的演变,以及云平台在 AI 工作负载处理上的技术思路。他强调,该计划旨在让中文听众无需语言障碍,即可领略全球优质外语播客的风采,同时保留原声音特色,提升听众的沉浸感。本期节目通过“latent space”的深度对谈,展现了 AI 领域在基础设施和云平台技术方面的最新进展,为听众提供了深入了解 AI 工程的宝贵机会。

发言人3

他回顾了项目早期关键问题对发展的推动作用,指出技术已显著进化,特别是 agent 原生原语和云代码的引入,强化了 GPU 沙箱托管小模型的价值,提及持续学习的早期迹象和推测解码的成效。他讨论了高效推理、开源模型及增量价值,分析了推理市场新趋势,如对话生物图像和视频制作,对 Luma agent 作为单点解决方案表现出浓厚兴趣,整体反映了对技术演进、创新应用与市场趋势的深度洞察。

发言人2

分享了公司战略从开发者体验转向强化 agent 体验的转变,强调了提升效率和实时性的重要性。通过简化装饰器参数调整等手段,显著提升了 agent 工作效率。他们感激听众支持,鼓励订阅无广告内容。深入探讨了构建灵活 GPU 推理平台,满足多行业需求,特别是在数据工程和 AI 领域的创新。与客户紧密合作,利用开源技术和内部研发推动技术前沿。未来将聚焦基础设施优化,提供更高效灵活解决方案,探索视频生成和 CI/CD 流程融合,以适应市场快速变化。

AI基础设施 弹性推理 GPU沙箱 开发者体验 突发性负载 自供应 可观测性 沙箱工作负载 流量模式 定制模型 大语言模型 循环自我修正 工具调用 AI工程 云平台 推理训练 GPU 自动缩放 推理 快照

Content Overview

📝 本期播客简介

本期我们克隆了:知名 AI 工程播客 Latent SpaceThe AI Infra Stack: DeFlash, Auto Endpoints, RDMA, and Sandboxes — Akshat Bubna, Modal CTO

原内容更新时间:2026-07-08

本期嘉宾是云平台 Modal 的 CTO Akshat Bubna,主持人是 swyx 和 Vibhu。Modal 刚完成 C 轮融资,正从一家"为开发者提供更好体验"的公司,转向"为 AI Agent 提供更好体验"的公司。他们服务着 Suno、Runway、Cognition 等一众前沿 AI 公司,为弹性推理、模型训练和 Agent 沙箱提供底层算力。

这期节目不是 Modal 的产品发布会,而是一场关于 AI 基础设施本质的深度思辨。Akshat 详细拆解了为什么传统云架构(尤其是 Kubernetes)从根本上不适合突发性、算力密集型的 AI 工作负载,以及 Modal 如何用"自供应运行时"和"代码即配置"的理念来替代 YAML 地狱。如果你在思考 AI 应用的部署、Agent 的沙箱安全、推理性能优化,或者云平台的未来形态,这期会提供大量来自一线构建者的高密度判断。

👨‍⚕️ 本期嘉宾

Akshat Bubna,云平台 Modal 的联合创始人兼 CTO。Modal 是一个专为 AI 工作负载从零构建的云平台,覆盖弹性推理、分布式训练、批处理和 Agent 沙箱等场景。Akshat 带领团队在 GPU 快照、推测解码(DFlash)、自动缩放等底层技术上做了大量开源贡献,服务着从大语言模型到计算生物学、机器人等领域的头部 AI 公司。

⏱️ 时间戳

Modal 的起源与核心理念 02:50 创业起点:为什么工作流编排产品都那么难用 03:46 构建更好的运行时:从 serverless 函数到 GPU 推理 05:34 核心理念:用装饰器定义一切,告别 YAML

从开发者体验到 Agent 体验 06:53 SDK 团队方向转向 Agent 体验 07:34 Agent 时代的新重点:可观测性比代码本身更重要 08:33 Modal 是什么:一个为 AI 应用从零搭建的云平台

弹性推理:Modal 的核心战场 13:24 最大用例是弹性推理,刻意避开大语言模型领域 14:34 技术护城河:GPU 快照与自动缩放 16:24 开源 DFlash:基于块的推测解码,实现乘法级性能提升

沙箱、网络与 Agent 基础设施 10:52 2023 年就做了沙箱,第一个例子是让 Agent 自我迭代 26:42 沙箱支持 sidecar,一个 pod 里跑多个容器 27:38 隐藏功能 I6PN:用 IPv6 构建的私有覆盖网络

训练、批量处理与容量管理 31:28 多节点训练聚焦小规模后训练,不做大规模预训练 35:24 计算策略团队:如何在 17 家云厂商之上做容量规划 36:51 批量处理层:不在乎延迟就能拿到便宜得多的价格

Agent 时代的云与未来展望 40:04 如何看待托管 Agent 与基础设施层的关系 47:12 CI/CD 的浪费:用内存快照让 Agent 驱动的 CI 更高效 50:19 公司能否只靠更好的 Agent 体验就做起来

🌟 精彩内容

💡 "你为什么要让一个 Agent 去读几百个 Kubernetes 文件、写那种连类型都没有的 YAML?"

Akshat 指出,Agent 体验和开发者体验在本质上高度一致——好的工具应该让使用者(无论人还是 AI)用最简单的方式表达意图,而不是陷入配置文件的泥潭。Modal 的答案是:用代码中的装饰器声明需求,运行时自动供应。

"它明明只需要改几个装饰器里的参数,就能得到一个自供应的运行时,直接看到自己的改动实时生效。"

💡 AI 工作负载不是 Web 服务器,Kubernetes 的慢速扩缩容根本不适合

传统云架构为常驻型 Web 服务设计,扩缩容是渐进的。但 AI 推理和训练是突发性的——你可能需要在几分钟内从 1000 张 GPU 扩到 1500 张,而且必须在特定区域内完成。Modal 从第一天就为这种"算力密集型、高度突发"的负载设计。

"Kubernetes 是为慢速扩缩容设计的,更适合 Web 服务器那种场景。而这些工作流需要快速伸缩,运行环境也越来越专门化。"

💡 推测解码的加速是乘法级的,不是优化 kernel 那几个百分点能比的

Akshat 解释了推测解码的核心逻辑:用小模型预测 token,大模型批量验证。关键指标是"接受长度"——只要草稿模型产出的 token 被足够多地接受,就能获得数倍加速。Modal 开源的 DFlash 在此基础上做基于块的推测,进一步提升效率。

"优化 kernel 通常只能带来几个百分点的提升,而提高接受长度,带来的可是乘法级的降低。"

💡 沙箱的硬边界不可替代,用 LLM 中介权限让人不安

当 swyx 提出"AI 操作系统的内核可能就是一个 LLM"时,Akshat 明确表达了怀疑。他认为沙箱层面必须有硬边界来防止数据泄露,LLM 只能作为软护栏的补充。这是基础设施构建者对安全底线的坚持。

"我对沙箱层面用 LLM 来中介权限持怀疑态度,因为你确实需要硬边界。不然的话,别人显然可以把数据偷出去。"

💡 我们刻意不做模型 API,因为纯爱好者市场粘性低

与竞争对手 Replicate 不同,Modal 选择不提供"一键调用模型"的 API 服务。Akshat 认为,真正在打造产品的公司需要的是代码级的灵活性和控制力,而不是一个黑盒 API。这种筛选效应让 Modal 的客户更有差异化,粘性也更强。

"我们一直刻意避开的一件事,就是给模型提供 API。我们一直想服务的是那些在打造产品、需要更多灵活性的公司,而不只是要一个 API。"

💡 在 17 家云厂商之上构建可靠性层,让用户接触到的容量比自己能拿到的多得多

Modal 没有自己的数据中心,而是在全球 17 家云厂商和裸金属提供商之上构建了一个"超级云"。他们在上面加了一层可靠性抽象,让 GPU 掉线或故障对用户工作负载透明。这种轻资产、重软件的策略让他们能专注在真正的差异化上。

"新云厂商的可靠性程度各不相同,所以我们花了很多时间在上面构建了我们自己的可靠性层。这实际上让我们能使用的容量,比你自己作为用户能接触到的要多得多。"

💡 基础设施最激动人心的时代,之前其实无聊了好一阵子

swyx 回顾了过去几年的变化:从"你很难让人对数据基础设施兴奋起来",到现在"大家都在意了"。Akshat 认同这一点,并指出规模是一切变化的底层驱动力——AI 需要的算力规模让基础设施重新变成了一个性感且充满挑战的领域。

"这是个非常激动人心的时代。我觉得很大一部分原因是,这一切需要的规模太大了。"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺;

如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight

Make your daily reading actually fit you.A daily brief built from the sources you follow. Get started free

AI 基础设施演变:从开发者体验到 Agent 体验的转变

CH.1 · 00:00 — 02:26

00:00 / 00:00

查看原文 → 發佈: 2026-07-09 09:46:11 收錄: 2026-07-09 12:00:40

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。