PODCAST
90
Modal CTO Akshat Bubna deeply analyzes why traditional cloud architectures like Kubernetes are ill-suited for bursty, compute-intensive AI workloads, and shares hands-on experience in redesigning cloud platforms for AI Agents using the concepts of 'self-provisioning runtime' and 'code as configuration.' 
Today 52:04 13 chapters View Source →
00:00 00:00
CH.1 AI 基础设施演变:从开发者体验到 Agent 体验的转变 00:00 — 02:26
00:00 1
欢迎收听跨国串门计划,这是一档专注于让中文听众无障碍欣赏全球优质外语播客的节目。通过先进的 AI 声纹克隆技术,我们不仅将内容翻译成中文,还完美保留了原主持人和嘉宾的独特声音,为您呈现全球顶尖的 AI 财经健康与科技领域精品内容。我是主播一凯,一位热衷于 AI 领域的产品经理,很荣幸能为您搭建这座跨越语言障碍的桥梁。接下来让我为您简单介绍本期我们克隆的这档节目。本期我们克隆的是知名 AI 工程播客 latent space 在 2026 年 7 月的一期深度对谈。主持人 swiss 和 vivo 与嘉宾 AK chat barba 展开交流。AK shut 是云平台 model 的 CTO,这家公司刚完成 C 轮融资,正从开发者体验转向 agent 体验,为很多前沿 AI 公司提供弹性推理和沙箱等底层能力。这一期他们主要围绕 AI 基础设施的演变展开,聊到了为什么传统云架构不适合突发性的 AI 工作负载,以及 model 在推理训练和 agent 沙箱方面的技术思路。那我们就一起来听听这期的完整对话。
01:15 2
我们其实已经把 SK 团队的方向从开发者体验转向了 agent 体验。而且我们认为那些对开发者体验有好处的点对 agent 体验同样适用。就是说你为什么要让一个 agent 去读几百个 cube ladies 文件,写那种连类型都没有的阴谋呢?他明明只需要改几个装饰器里的参数,就能得到一个自供应的,运行时直接看到自己的改动,实时生效。
01:43 2
在进入今天的正题之前,我想对听众说几句,谢谢你们。如果你们没有选择点进来收听我们的内容,我们就没法给大家带来你们这么想听的 AI 工程科学和娱乐内容。几乎每天都有人来找我们谈赞助,但好在有过多的朋友真的订阅了我们,让我们能在没有广告的情况下持续做下去。我们也想保持这样,但我有个小请求想拜托大家,你们能做的最有力也完全免费的一件事就是点一下那个订阅按钮。这是我唯一想请大家做的事儿,对我和我的团队来说意义重大。我们每周都拼尽全力把 latent space 带给你们。如果你们点了,我保证我们会一直努力把节目做得更好。
Click any line to jump · Hover to ask AI
Content Overview
Model 公司通过创新技术,如 GPU 推理、自动化研究、多节点训练等,简化复杂技术并集成到平台中,提供用户友好型解决方案。其软件层差异化优势,专注于高效、透明、可扩展性和高性能,支持从简易操作到高级模型调整。Model 在 GPU 与 CPU 协同、网络架构优化、以及 Agent 底层能力构建方面展现前瞻性,致力于成为连接基础实验室与企业用户的桥梁,推动 AI 技术广泛应用。公司还从开发者体验转向 Agent 体验,提供弹性推理和沙箱能力,通过开源技术与客户合作,推动 AI 应用快速迭代和优化。未来,Model 将探索多模态处理、视频生成及计算生物学等领域的突破,引领 AI 基础设施发展。
#### Speaker Summaries
发言人1
介绍了“跨国串门计划”这档节目,利用 AI 声纹克隆技术为中文听众提供无障碍欣赏全球优质外语播客的体验,特别保留原主持人和嘉宾的声音特色。作为热衷于 AI 领域的主播,他重点介绍了本期克隆的知名 AI 工程播客“latent space”的深度对谈,讨论了 AI 基础设施的演变,以及云平台在 AI 工作负载处理上的技术思路。他强调,该计划旨在让中文听众无需语言障碍,即可领略全球优质外语播客的风采,同时保留原声音特色,提升听众的沉浸感。本期节目通过“latent space”的深度对谈,展现了 AI 领域在基础设施和云平台技术方面的最新进展,为听众提供了深入了解 AI 工程的宝贵机会。
发言人3
他回顾了项目早期关键问题对发展的推动作用,指出技术已显著进化,特别是 agent 原生原语和云代码的引入,强化了 GPU 沙箱托管小模型的价值,提及持续学习的早期迹象和推测解码的成效。他讨论了高效推理、开源模型及增量价值,分析了推理市场新趋势,如对话生物图像和视频制作,对 Luma agent 作为单点解决方案表现出浓厚兴趣,整体反映了对技术演进、创新应用与市场趋势的深度洞察。
发言人2
分享了公司战略从开发者体验转向强化 agent 体验的转变,强调了提升效率和实时性的重要性。通过简化装饰器参数调整等手段,显著提升了 agent 工作效率。他们感激听众支持,鼓励订阅无广告内容。深入探讨了构建灵活 GPU 推理平台,满足多行业需求,特别是在数据工程和 AI 领域的创新。与客户紧密合作,利用开源技术和内部研发推动技术前沿。未来将聚焦基础设施优化,提供更高效灵活解决方案,探索视频生成和 CI/CD 流程融合,以适应市场快速变化。
AI基础设施 弹性推理 GPU沙箱 开发者体验 突发性负载 自供应 可观测性 沙箱工作负载 流量模式 定制模型 大语言模型 循环自我修正 工具调用 AI工程 云平台 推理训练 GPU 自动缩放 推理 快照
Content Overview
📝 本期播客简介
本期我们克隆了:知名 AI 工程播客 Latent SpaceThe AI Infra Stack: DeFlash, Auto Endpoints, RDMA, and Sandboxes — Akshat Bubna, Modal CTO
原内容更新时间:2026-07-08
本期嘉宾是云平台 Modal 的 CTO Akshat Bubna,主持人是 swyx 和 Vibhu。Modal 刚完成 C 轮融资,正从一家"为开发者提供更好体验"的公司,转向"为 AI Agent 提供更好体验"的公司。他们服务着 Suno、Runway、Cognition 等一众前沿 AI 公司,为弹性推理、模型训练和 Agent 沙箱提供底层算力。
这期节目不是 Modal 的产品发布会,而是一场关于 AI 基础设施本质的深度思辨。Akshat 详细拆解了为什么传统云架构(尤其是 Kubernetes)从根本上不适合突发性、算力密集型的 AI 工作负载,以及 Modal 如何用"自供应运行时"和"代码即配置"的理念来替代 YAML 地狱。如果你在思考 AI 应用的部署、Agent 的沙箱安全、推理性能优化,或者云平台的未来形态,这期会提供大量来自一线构建者的高密度判断。
👨⚕️ 本期嘉宾
Akshat Bubna,云平台 Modal 的联合创始人兼 CTO。Modal 是一个专为 AI 工作负载从零构建的云平台,覆盖弹性推理、分布式训练、批处理和 Agent 沙箱等场景。Akshat 带领团队在 GPU 快照、推测解码(DFlash)、自动缩放等底层技术上做了大量开源贡献,服务着从大语言模型到计算生物学、机器人等领域的头部 AI 公司。
⏱️ 时间戳
Modal 的起源与核心理念 02:50 创业起点:为什么工作流编排产品都那么难用 03:46 构建更好的运行时:从 serverless 函数到 GPU 推理 05:34 核心理念:用装饰器定义一切,告别 YAML
从开发者体验到 Agent 体验 06:53 SDK 团队方向转向 Agent 体验 07:34 Agent 时代的新重点:可观测性比代码本身更重要 08:33 Modal 是什么:一个为 AI 应用从零搭建的云平台
弹性推理:Modal 的核心战场 13:24 最大用例是弹性推理,刻意避开大语言模型领域 14:34 技术护城河:GPU 快照与自动缩放 16:24 开源 DFlash:基于块的推测解码,实现乘法级性能提升
沙箱、网络与 Agent 基础设施 10:52 2023 年就做了沙箱,第一个例子是让 Agent 自我迭代 26:42 沙箱支持 sidecar,一个 pod 里跑多个容器 27:38 隐藏功能 I6PN:用 IPv6 构建的私有覆盖网络
训练、批量处理与容量管理 31:28 多节点训练聚焦小规模后训练,不做大规模预训练 35:24 计算策略团队:如何在 17 家云厂商之上做容量规划 36:51 批量处理层:不在乎延迟就能拿到便宜得多的价格
Agent 时代的云与未来展望 40:04 如何看待托管 Agent 与基础设施层的关系 47:12 CI/CD 的浪费:用内存快照让 Agent 驱动的 CI 更高效 50:19 公司能否只靠更好的 Agent 体验就做起来
🌟 精彩内容
💡 "你为什么要让一个 Agent 去读几百个 Kubernetes 文件、写那种连类型都没有的 YAML?"
Akshat 指出,Agent 体验和开发者体验在本质上高度一致——好的工具应该让使用者(无论人还是 AI)用最简单的方式表达意图,而不是陷入配置文件的泥潭。Modal 的答案是:用代码中的装饰器声明需求,运行时自动供应。
"它明明只需要改几个装饰器里的参数,就能得到一个自供应的运行时,直接看到自己的改动实时生效。"
💡 AI 工作负载不是 Web 服务器,Kubernetes 的慢速扩缩容根本不适合
传统云架构为常驻型 Web 服务设计,扩缩容是渐进的。但 AI 推理和训练是突发性的——你可能需要在几分钟内从 1000 张 GPU 扩到 1500 张,而且必须在特定区域内完成。Modal 从第一天就为这种"算力密集型、高度突发"的负载设计。
"Kubernetes 是为慢速扩缩容设计的,更适合 Web 服务器那种场景。而这些工作流需要快速伸缩,运行环境也越来越专门化。"
💡 推测解码的加速是乘法级的,不是优化 kernel 那几个百分点能比的
Akshat 解释了推测解码的核心逻辑:用小模型预测 token,大模型批量验证。关键指标是"接受长度"——只要草稿模型产出的 token 被足够多地接受,就能获得数倍加速。Modal 开源的 DFlash 在此基础上做基于块的推测,进一步提升效率。
"优化 kernel 通常只能带来几个百分点的提升,而提高接受长度,带来的可是乘法级的降低。"
💡 沙箱的硬边界不可替代,用 LLM 中介权限让人不安
当 swyx 提出"AI 操作系统的内核可能就是一个 LLM"时,Akshat 明确表达了怀疑。他认为沙箱层面必须有硬边界来防止数据泄露,LLM 只能作为软护栏的补充。这是基础设施构建者对安全底线的坚持。
"我对沙箱层面用 LLM 来中介权限持怀疑态度,因为你确实需要硬边界。不然的话,别人显然可以把数据偷出去。"
💡 我们刻意不做模型 API,因为纯爱好者市场粘性低
与竞争对手 Replicate 不同,Modal 选择不提供"一键调用模型"的 API 服务。Akshat 认为,真正在打造产品的公司需要的是代码级的灵活性和控制力,而不是一个黑盒 API。这种筛选效应让 Modal 的客户更有差异化,粘性也更强。
"我们一直刻意避开的一件事,就是给模型提供 API。我们一直想服务的是那些在打造产品、需要更多灵活性的公司,而不只是要一个 API。"
💡 在 17 家云厂商之上构建可靠性层,让用户接触到的容量比自己能拿到的多得多
Modal 没有自己的数据中心,而是在全球 17 家云厂商和裸金属提供商之上构建了一个"超级云"。他们在上面加了一层可靠性抽象,让 GPU 掉线或故障对用户工作负载透明。这种轻资产、重软件的策略让他们能专注在真正的差异化上。
"新云厂商的可靠性程度各不相同,所以我们花了很多时间在上面构建了我们自己的可靠性层。这实际上让我们能使用的容量,比你自己作为用户能接触到的要多得多。"
💡 基础设施最激动人心的时代,之前其实无聊了好一阵子
swyx 回顾了过去几年的变化:从"你很难让人对数据基础设施兴奋起来",到现在"大家都在意了"。Akshat 认同这一点,并指出规模是一切变化的底层驱动力——AI 需要的算力规模让基础设施重新变成了一个性感且充满挑战的领域。
"这是个非常激动人心的时代。我觉得很大一部分原因是,这一切需要的规模太大了。"
🌐 播客信息补充
本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的
使用 AI 进行翻译,因此可能会有一些地方不通顺;
如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight
Make your daily reading actually fit you.A daily brief built from the sources you follow. Get started free
AI 基础设施演变:从开发者体验到 Agent 体验的转变
CH.1 · 00:00 — 02:26
00:00 / 00:00