OpenAI 研究科学家 Noam Brown 深度剖析,在测试时计算时代,传统静态基准测试已彻底失灵,模型能力本质上是推理预算的函数。
📝 详细摘要
本期节目是硅谷知名投资人 Sarah Guo 与 OpenAI 研究科学家 Noam Brown 的深度对谈。Noam 作为 AI 推理与测试时计算扩展的先驱,详细阐述了其在近期引发广泛共鸣的核心论点:传统的基准测试表格已无法适应现代模型。他指出,模型的能力不再是固定值,而是你愿意投入多少推理预算的函数。因此,仅凭单一分数比较模型毫无意义,正确的评估应设定预算上限或绘制性能曲线。对话还深入探讨了安全评估的盲区,即现有政策未考虑不同的推理预算可能解锁截然不同的模型能力;用实际案例揭示了用户和大厂都未曾充分探索当前模型的能力上限(如推翻 Erdős 单位距离猜想的成本仅需数千美元);并前瞻了递归自我改进的渐进式路径以及对前沿竞争格局的一手观察。Noam 呼吁行业打破“虚假的均衡”,正视并改革评估体系。
💡 主要观点
- 静态基准测试表格在推理时计算时代已经失效 模型能力是推理预算的函数,不控制思考时间就对比模型,如同不控制车速就对比油耗。5.5 在发布时的表格提升不大,但一旦控制思考时间,其对 5.4 的优势就是巨大的飞跃。
💬 文章金句
- 现有的准备框架和责任缩放政策,并没有真正考虑测试时计算量。问题在于,我们现在所处的世界,模型的能力基本上是你投入多少钱的函数。你给他 1 万美元的预算,他能做的比 10 美元预算多得多。给他 1000 万美元预算他能做的更多。那你应该在什么预算下评估这些模型?现有的政策并没有真正解决这个问题。
- 本来有人可以在我们之前就用通用模型推翻 Erdős 单位距离猜想。只是没有人充分探索过,如果我把价值 100,000 美元的算力砸进 5.5,会发生什么?
- 所有人的反应是,外界期望我们发布那个表格。那为什么外界会期望发布表格呢?因为每个人都在发布表格。于是你就陷入了一种糟糕的均衡,所有人都知道这不好,但没人愿意打破它。
- 如果需要那么多测试时计算才能解锁模型的全部能力,那就意味着你被时间卡住了。事情只能快到一定程度。时间本身成了我们能做什么的瓶颈。
📊 文章信息
AI 初评:89
来源:跨国串门儿计划
作者:跨国串门儿计划
分类:人工智能
语言:中文
阅读时间:46 分钟
字数:11285
标签: AI评估, 测试时计算, 推理预算, 基准测试, 安全评估