本文编译整理了图灵奖得主、Postgres 奠基者 Mike Stonebraker 的播客访谈,他犀利批判了谷歌 MapReduce 与最终一致性、甲骨文的商业手段、AI Text-to-SQL 在真实场景的无效性,并分享了对数据库技术演进、工程师招聘、以及未来 AI Agent 与数据库融合的深刻洞见。
📝 详细摘要
文章是对数据库领域泰斗 Mike Stonebraker 一次深度访谈的编译整理。Stonebraker 以直言不讳的风格,回顾了 Ingres 和 Postgres 的创立初衷,核心在于构建一个可扩展的类型系统以应对 GIS、金融等非标准数据类型。他尖锐批评了谷歌 MapReduce 和最终一致性是“蠢事”,认为甲骨文早期靠对客户撒谎赢得市场。对于当前热点,他基于真实生产数据仓库的基准测试(Beaver)指出,最先进的 Text-to-SQL 模型得分仅为 0%,揭示了学术基准(如 Spider、BIRD)与工业实践的巨大鸿沟。此外,他讨论了“万金油”数据库的局限性,分享了识别顶尖工程师的方法,并展望了未来:随着 AI Agent 从只读转向读写,数据库将重回核心,其创办的 DBOS 公司正致力于通过将应用状态深度嵌入数据库,为工作流和 Agent 提供事务性、持久化等原生支持。
💡 主要观点
- 当前热门的 Text-to-SQL 在真实生产数据仓库基准测试中得分为 0%,远未达到实用水平。 Stonebraker 团队在四个匿名化的真实数据仓库上测试发现,由于数据不在公共训练语料库、查询复杂度高(达 100 行 SQL)、数据模式混乱且包含专业术语,导致现有 LLM 方案完全失效,揭示了学术基准与工业实践的脱节。
💬 文章金句
- 今天最热的 Text-to-SQL 在自己的基准上得分是 0。
- MapReduce 是谷歌干过的蠢事之一。谷歌后来连 eventual consistency 这条路也走错了,最后还是回到了 Spanner 这种传统事务系统。
- 拉里·埃里森是个绝佳的推销员。在当时,他能把‘现在时’和‘将来时’混为一谈,说白了就是对客户撒谎。
- Postgres 的核心要义:它具备极高的灵活性。
- 一旦它涉及到读写操作,它就变成了一个分布式数据库问题,你会需要原子性、一致性等等所有这些特性。
📊 文章信息
AI 初评:87
来源:AI科技大本营
作者: AI科技大本营
分类:人工智能
语言:中文
阅读时间:54 分钟
字数:13272
标签: Mike Stonebraker, 数据库, Postgres, Text-to-SQL, AI Agent