← 回總覽

OpenAI Noam Brown:模型评估方式,正在错过 AI 真正的能力上限

📅 2026-06-29 15:37 跨国串门儿计划 人工智能 2 分鐘 1813 字 評分: 89
AI评估 测试时计算 推理预算 基准测试 安全评估
📌 一句话摘要 OpenAI 研究科学家 Noam Brown 深度剖析,在测试时计算时代,传统静态基准测试已彻底失灵,模型能力本质上是推理预算的函数。 📝 详细摘要 本期节目是硅谷知名投资人 Sarah Guo 与 OpenAI 研究科学家 Noam Brown 的深度对谈。Noam 作为 AI 推理与测试时计算扩展的先驱,详细阐述了其在近期引发广泛共鸣的核心论点:传统的基准测试表格已无法适应现代模型。他指出,模型的能力不再是固定值,而是你愿意投入多少推理预算的函数。因此,仅凭单一分数比较模型毫无意义,正确的评估应设定预算上限或绘制性能曲线。对话还深入探讨了安全评估的盲区,即现有政策未考

📌 一句话摘要

OpenAI 研究科学家 Noam Brown 深度剖析,在测试时计算时代,传统静态基准测试已彻底失灵,模型能力本质上是推理预算的函数。

📝 详细摘要

本期节目是硅谷知名投资人 Sarah Guo 与 OpenAI 研究科学家 Noam Brown 的深度对谈。Noam 作为 AI 推理与测试时计算扩展的先驱,详细阐述了其在近期引发广泛共鸣的核心论点:传统的基准测试表格已无法适应现代模型。他指出,模型的能力不再是固定值,而是你愿意投入多少推理预算的函数。因此,仅凭单一分数比较模型毫无意义,正确的评估应设定预算上限或绘制性能曲线。对话还深入探讨了安全评估的盲区,即现有政策未考虑不同的推理预算可能解锁截然不同的模型能力;用实际案例揭示了用户和大厂都未曾充分探索当前模型的能力上限(如推翻 Erdős 单位距离猜想的成本仅需数千美元);并前瞻了递归自我改进的渐进式路径以及对前沿竞争格局的一手观察。Noam 呼吁行业打破“虚假的均衡”,正视并改革评估体系。

💡 主要观点

- 静态基准测试表格在推理时计算时代已经失效 模型能力是推理预算的函数,不控制思考时间就对比模型,如同不控制车速就对比油耗。5.5 在发布时的表格提升不大,但一旦控制思考时间,其对 5.4 的优势就是巨大的飞跃。

评估体系失灵导致我们从未真正了解模型的能力上限 现代模型有了合适的脚手架可以思考数周,平台期非常遥远。推翻 Erdős 猜想的案例表明,仅需 1000 到 10 万美元的推理预算,用通用的 5.5 模型即可完成数学界的突破性成果,但此前无人愿意花费此预算去尝试。
安全评估在刻意回避推理预算的问题 现有的安全框架多在测试时计算不重要时建立。但在当前时代,一千万美元预算下模型能做的事远超十美元预算,现有政策并未规定应该在多少预算下评估模型的危险能力。
递归自我改进将是一个被时间瓶颈卡住的渐进过程 AI 很难一夜之间实现智能爆炸,因为其最高智能极度依赖大规模测试时计算。这意味着模型需要运行足够久才能做出成果,时间本身成为解锁全部能力的最大瓶颈。
多智能体协作是尚未充分探索的方向,源于人类文明的类比 人类的力量在于数十亿人长时间思考并在彼此知识上构建。当前 AI 模型还做不到这种有机的知识积累与分享,它们诞生、存在于短上下文窗口、然后消失。未来将进入模型能够大规模协作、分享知识并持续构建的世界。

💬 文章金句

- 现有的准备框架和责任缩放政策,并没有真正考虑测试时计算量。问题在于,我们现在所处的世界,模型的能力基本上是你投入多少钱的函数。你给他 1 万美元的预算,他能做的比 10 美元预算多得多。给他 1000 万美元预算他能做的更多。那你应该在什么预算下评估这些模型?现有的政策并没有真正解决这个问题。

  • 本来有人可以在我们之前就用通用模型推翻 Erdős 单位距离猜想。只是没有人充分探索过,如果我把价值 100,000 美元的算力砸进 5.5,会发生什么?
  • 所有人的反应是,外界期望我们发布那个表格。那为什么外界会期望发布表格呢?因为每个人都在发布表格。于是你就陷入了一种糟糕的均衡,所有人都知道这不好,但没人愿意打破它。
  • 如果需要那么多测试时计算才能解锁模型的全部能力,那就意味着你被时间卡住了。事情只能快到一定程度。时间本身成了我们能做什么的瓶颈。

📊 文章信息

AI 初评:89

来源:跨国串门儿计划

作者:跨国串门儿计划

分类:人工智能

语言:中文

阅读时间:46 分钟

字数:11285

标签: AI评估, 测试时计算, 推理预算, 基准测试, 安全评估

收听完整播客

查看原文 → 發佈: 2026-06-29 15:37:11 收錄: 2026-06-29 18:00:50

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。