← 回總覽

Kimi K3、Qwen3.8-Max 官方评测都在用!伯克利硬核测试揭穿 AI 自进化假象

📅 2026-08-11 00:00 青稞AI 人工智能 8 分鐘 9541 字 評分: 88
AI Agent AI 评测 Auto-Research 自进化 AI 机器学习研究
📌 一句话摘要 本文深度解读伯克利 MLS-Bench 评测,指出当前 AI Agent 更擅长优化组合已有组件而非发现新方法,揭示了 Auto-Research 在方法发现层面的真实瓶颈。 📝 详细摘要 文章围绕伯克利大学提出的 MLS-Bench 评测展开,系统拆解了当前「自进化 AI」叙事中的三种能力层次:执行能力、系统外围更新与研究方法发现。作者指出,Auto-Research 的关键问题不在于 AI 是否参与了研发流程,而在于能否发现具有迁移性的新方法。MLS-Bench 覆盖 12 个机器学习领域、140 个真实研究任务,通过控制可修改范围、统一复现强人类基线、跨至少三个测试条

Title: Kimi K3、Qwen3.8-Max 官方评测都在用!伯克利硬核测试揭穿 AI 自进化假象 | BestBlogs.dev

URL Source: https://www.bestblogs.dev/article/82adc79ca0?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item

Published Time: 2026-08-11 00:00:00

Markdown Content: !Image 1: MLS-Bench 覆盖 12 个机器学习方向

MLS-Bench 覆盖 12 个机器学习方向

TL;DR

Auto-Research 系统正在快速发展,但当前多数成功案例建立在一个重要前提上:候选方案可以被廉价、快速、明确地验证。只要评分足够便宜,扩大采样与搜索就能持续提高找到好答案的概率。

真实机器学习研究并不总具备这个条件。完整训练昂贵,反馈存在延迟,单次实验只能提供部分证据。系统不仅要提出候选方法,还要判断什么假设值得验证、如何用有限预算组织实验,以及一个局部增益能否跨数据和规模成立。 MLS-Bench将这一问题构造成 12 个领域、140 个真实研究任务。它通过控制可修改范围、统一复现强人类方法,并在至少三个测试条件中检查迁移能力,将目标算法贡献与调参、容量和实现技巧分开。

实验分析显示,即使获得强基线代码并进行多轮实验,模型仍更擅长优化和组合已有组件,而不是发现新的机制;在更自由的算力分配实验中,它们也没有表现出可靠的实验规划与证据判断能力。 论文:https://arxiv.org/abs/2605.08678  项目主页:https://mls-bench.com/  代码:https://github.com/Imbernoulli/MLS-Bench!Image 2: MLS-Bench 论文首页

「自进化」正在同时指向几种不同能力

讨论 MLS-Bench 之前,需要先拆开当前「self-evolving AI」叙事中的几种目标。

第一层是执行能力。模型从生成代码片段,发展到能够进入仓库、运行命令、调用工具并完成长程任务。Anthropic 的内部数据记录了这种变化:Claude Code 在开放式问题上的会话成功率快速上升,Claude 编写的代码也已经占到其合并代码的 80% 以上。

!Image 3: Claude Code 在不同复杂度任务上的成功率变化

Claude Code 在不同复杂度任务上的成功率变化

_图片来自 Anthropic 的 When AI builds itself[1]。该图衡量的是内部编程会话,并不等价于方法发现。_

第二层是系统外围的持续更新。模型可以创建和复用技能、维护记忆、修改工具链,或参与数据构建与训练流程。MiniMax M2.7 将模型创建强化学习技能、更新记忆并优化自身学习过程称为模型自我进化,就是这一方向的代表。

第三层才是研究产物本身:系统能否提出一个此前不存在、而且比人类已有方案更好的方法。

前两层可以显著提高研发效率,也会成为第三层的重要基础,但三者不能直接等同。一个 Agent 可以写出大量训练代码,仍然只是更高效地执行人类给定的研究方向。

Richard Sutton 在《苦涩的教训》中给出了更高的目标:真正长期有效的往往是能够利用更多计算的通用方法;我们最终需要的是能完成发现过程的 Agent,而不只是包含人类已有发现的系统。

因此,Auto-Research 的关键问题不只是「AI 是否参与了 AI 研发」,而是它能否发现具有迁移性、并能随数据与计算继续发挥作用的方法。ResNet、Transformer、扩散模型、RMSNorm 与 PPO 之所以推动机器学习发展,正是因为它们超越了单个实例。

问题不在于能否执行研究,而在于能否归因方法进步

围绕自进化 Agent 的讨论中,「系统完成了多少研究步骤」经常被用来衡量能力。一个完整系统可以检索文献、生成想法、修改代码、运行实验,再根据结果继续迭代。

但研究流程的覆盖程度,与方法发现能力并不等价。

假设某个候选提交获得了更高分,增益可能来自四类不同因素:

  • 1. 目标算法组件发生了有效变化;
  • 2. 超参数和训练日程被更充分地搜索;
  • 3. 数据、模型容量或计算预算发生了变化;
  • 4. 系统利用了评分流程或测试条件中的捷径。
如果这些因素没有被分开,最终分数无法说明模型是否发现了更好的方法。

这一区分在廉价验证任务中不一定重要。对于 circle packing、kernel 优化或固定训练 speedrun,目标本身就是在明确约束下找到更高分的候选,任何合法路径都可以被接受。大规模搜索因此是合理的核心机制。

方法发现面对的是另一种目标。一个有价值的机器学习方法,通常需要在数据、模型、环境或规模发生变化后继续有效。它不仅要提高指标,还应捕捉一个比当前实例更一般的问题结构。

MLS-Bench 的核心贡献,是为这种方法级进步建立可执行、可归因的测试环境。

任务设计:140 个研究问题,12 个领域

MLS-Bench 覆盖语言模型预训练与后训练、视觉生成、强化学习、机器人、机器学习系统、AI for Science、优化与理论、因果推断、时间序列与可信学习等 12 个方向,共包含 140 个任务。

具体任务包括 KV 缓存压缩、主动学习、时空交通预测、黑洞图像逆问题、抗体与抗原结合、机器人世界模型、训练量化以及优化与理论问题。这样的覆盖不仅增加题目数量,也把不同研究社区对「有效方法」的判断引入同一评测。

完整评测只运行每题一个候选方案,约需 700 个 H100 小时。覆盖全部 12 个领域的 30 题 MLS-Bench-Lite,单次评测仍约需 90 个 H100 小时。若允许 Agent 在提交前探索多个候选,实际成本还会继续增加。这种成本不是额外包装,而是执行真实训练与跨条件验证的直接结果。

每个任务来自真实代码库,并围绕一个具体研究组件构造。模型可能需要改进训练目标、优化器、注意力机制、采样策略或路由规则。提交形式不是文本答案,而是能够在给定代码库中训练和评测的实现。

!Image 4: MLS-Bench 从固定实例优化转向方法级发现

MLS-Bench 从固定实例优化转向方法级发现

_单个实例上的分数提升不足以证明方法成立,候选提交还需要跨条件验证。_

每项任务都包含:

* • 具体研究问题与真实代码库;

* • 经过领域专家校准的可修改组件;

* • 至少三个用于检验迁移能力的测试条件;

* • 至少三种强人类基线,其中包含领域公认的 SOTA;

* • 在统一代码库、训练协议和评分流程中复现的基线结果。

这些要素共同服务于两个目标:控制增益来源,以及检查方法的可推广性。

为什么必须重新实现强人类基线

很多评测直接引用论文报告的基线数字,但不同方法往往使用不同代码、数据版本、训练预算与实现细节。将这些数字放在一张表中,并不能形成严格对照。

MLS-Bench 要求每个任务至少复现三种强人类方法。复现结果首先用于建立统一参考,也用于反向校准可修改范围。

如果公认的最佳方法无法在指定组件内实现,说明限制过窄,评测可能排除真实创新;如果不修改目标组件也能通过其他路径显著提分,说明限制过宽,算法贡献无法归因。

最终形成的边界需要同时满足两点:

* • 表达能力足以容纳当前强方法;

* • 模型无法修改目标研究问题以外的环节。

可行性还涉及训练规模。对于原始成本过高的任务,团队会使用较小模型或较少数据,但要求所有强人类方法在缩小规模后保持原有性能排序。缩小后的实验如果改变了方法之间的相对优劣,就不能作为原问题的有效代理。140 个任务都要经过这项校准。

!Image 5: MLS-Bench 的受控研究过程

MLS-Bench 的受控研究过程

_强人类方法与模型提交在相同代码和训练流程中比较。_

例如,研究训练目标时,数据管线、评分器和共享训练流程保持不变;研究结构时,评测会检查参数规模,避免候选通过增加容量获得优势。对不同任务,测试条件会改变数据集、模型、环境或规模,以检验一个局部改动能否迁移。

由于不同领域包含不同条件和指标,论文使用三级聚合得到统一分数。每个原始指标先以复现的人类基线为锚点进行变换,最弱基线对应 0 分,最强基线对应 50 分;随后在测试条件内聚合,再形成任务级分数。存在理论上界的指标仍保留超过 50 分的空间。

这套设计实际上将研究评测转换成一种受控实验:只允许目标算法变量发生变化,再观察变化能否在多个条件中产生一致收益。

主实验:多轮迭代提高分数,但不等于方法发现

主实验评测五个前沿模型,并提供两种运行方式。

第一种评估模型首次提出并实现的方案;第二种允许模型进入代码库,多轮运行实验、读取反馈和修改实现。

每个模型还会获得强基线代码,包括当前公认的最佳方法。因此,这里不主要考查文献复现或代码重建,而是考查模型能否在强方法之上继续进行方法发现。

!Image 6: 不同领域中的模型与复现方法表现

不同领域中的模型与复现方法表现

_网页柱状图按领域对比模型首次方案、多轮实验结果与 Human SOTA。_

论文主实验中,多轮实验能够提高模型得分,但当时评测的五个模型所提出的方法在整体表现上均未超过 Human SOTA。随着后续更强模型进入公开榜单,汇总成绩仍在继续上涨。不过,当前领先成绩的绝对水平依然不高,评测远未饱和。与此同时,总分是否越过某个基线锚点,也不是判断方法创新的充分条件。

更有诊断意义的是候选方法的组成与跨条件行为。对论文初版五个模型的消融和专家分析显示,模型的提升主要来自已有组件的调优与重组,新的方法机制仍然少见。

参数规模检查的控制实验展示了为什么这些限制不可省略。移除检查后,所有模型都会通过扩大参数量获得收益,部分结果可以超过人类基线;恢复检查后,这些表面提升消失。若只观察最终分数,这类容量增长很容易被错误归因成算法创新。

重要的是,这个结果并非来自工具调用失败。模型能够修改代码、启动训练并根据结果迭代。主要差距出现在候选方法本身:模型很少提出具有新机制、并能在多个条件下持续成立的改进。

提示消融与专家分析:优化能力强于发现能力

研究团队通过提示消融区分模型的两种行为。

当任务目标更偏向「优化现有方法」时,模型表现更好;当目标要求「发现一种新方法」时,结果更弱。这说明当前 Agent 更适合在已有方向上进行局部工程搜索。

专家案例分析进一步检查了候选方案的组成。模型经常从多个基线中抽取损失、模块与训练策略,再进行重组和参数调整。这样的方案可以产生局部收益,但真正新的机制很少;即使模型提出了新结构,也往往缺少一个能够解释其有效性并指导跨条件验证的有洞见假设。

!Image 7: 模型提交与强基线的关系

模型提交与强基线的关系

_模型方案通常贴近已经提供的基线组件。_

这里需要区分「新组合」与「新方法」。前者可以在特定系统中具有工程价值;后者则要求对已有方法的局限给出新的解释,并由可迁移实验支持。MLS-Bench 测到的主要瓶颈,正是从前者走向后者的能力。

测试时扩展为什么没有跨过这条边界

对于可自动验证任务,一个自然方案是增加迭代与采样量。

MLS-Bench 的测试时扩展实验确认,更多尝试通常能够提高分数,但收益很快饱和,尤其是在更困难的研究任务中。

!Image 8: 测试时扩展的收益与上限

测试时扩展的收益与上限

_增加迭代和采样能够改善局部结果,但收益会逐渐饱和。_

当模型只能看到部分测试反馈时,继续搜索还可能造成另一个问题:候选方案更适应可见条件,却在未开放条件中退化。这是方法发现与固定目标优化之间的直接区别。

大规模采样可以更充分地搜索一个已经定义的候选空间,但真正的方法发现往往需要重新定义空间。模型要先识别现有方法为何失败,形成一个有解释力的假设,再决定什么候选值得进入实验。采样量本身不能提供这一判断。

预训练实验:更多算力选项没有带来更好的研究决策

方法提出只是科学工作的一部分。研究者还需要在有限资源下选择实验,并根据不完整反馈更新假设。

论文构造了一个受算力约束的真实预训练环境。固定流程原本允许三次完整的 345M 参数训练;新的实验将前两次完整训练转换为自适应预算,由模型自行决定代理模型规模、训练 token 数和实验顺序。

这个设计让模型有机会执行常见的研究策略:先运行便宜的小实验,比较多个假设,再把昂贵的完整训练用于最有希望的方向。

结果并未显示出稳定优势。更多可选实验经常导致更差结果。一个模型积极消耗预算,最终性能下降;唯一取得提升的模型只使用了很少算力。

!Image 9: 模型自主安排预训练实验预算

模型自主安排预训练实验预算

_灵活预算测试的是实验价值判断,而不只是代码执行。_

模型在这里缺少的不只是一个更好的候选方法,还包括:

* • 选择能够区分多种解释的代理实验;

* • 判断小规模结果是否能够外推;

* • 根据新证据放弃或修正假设;

* • 决定何时值得进行昂贵验证。

团队还加入网页搜索、基线论文推导和相关理论背景。整体增益仍然有限,很多情况下与普通多轮迭代接近。

!Image 10: 额外上下文带来的增益有限

额外上下文带来的增益有限

_信息获取不是唯一瓶颈,关键还在于如何将知识转化为假设和证据。_

因此,当前模型不仅弱于提出新方法,也缺少建立与验证证据所需的、更广泛的科学判断力。

从可规模化搜索到可规模化科学发现

今天的自动发现范式来自一条连续技术路径。

AlphaGo 与 AlphaZero 在规则明确的博弈中结合模型与树搜索;AlphaTensor 将数学问题转换为可搜索的动作空间;FunSearch 让语言模型生成代码候选,并由自动评分器筛选;AlphaEvolve 进一步把候选扩展到完整程序,通过程序库、评分器和迭代生成形成进化循环。

这条路径不断扩大「可以搜索的对象」,但始终保留一个核心条件:验证必须足够快、足够明确,才能支撑大量候选的生成与淘汰。

形式化数学处在一个有意思的中间位置。Lean 编译器可以给出严格反馈,验证成本又高于简单数值函数。AlphaProof 一类系统可以围绕形式化状态进行广泛树搜索,Seed-Prover 一类方法则更多依赖强模型生成整段证明,再对失败局部进行修正。

!Image 11: AlphaProof 式的策略采样与证明树搜索

AlphaProof 式的策略采样与证明树搜索

_AlphaProof 使用证明网络为策略采样和树搜索提供引导。图源:Nature 正式论文[2]。_

!Image 12: Seed-Prover 的整段证明与分层修正过程

Seed-Prover 的整段证明与分层修正过程

_Seed-Prover 从整段证明生成出发,并在更高预算下利用 Lean 反馈逐层修正失败引理。图源:Seed-Prover 论文[3]。_

同一个领域能够同时容纳深搜索和更强模型推理,说明搜索并非错误路线。真正决定系统形态的是候选生成成本与验证成本之间的比例。

现有自进化系统的许多成功案例依赖廉价验证器。每个候选都能快速得到明确反馈,系统可以通过大规模采样近似换取更高成功率。

真实科学发现的约束恰好不同。验证可能昂贵、延迟、多阶段且只能部分观察。一次实验通常不能直接判定一个假设;系统需要通过多个代理实验逐步缩小解释空间,再决定是否投入更大预算。

因此,真正稀缺的资源不是候选数量,而是能够产生有效信息的计算。论文将这一问题概括为:在验证难以规模化的条件下,实现可规模化的科学发现。

这也意味着 Auto-Research 不能只沿着「更长循环、更多采样」扩展。完整能力至少包括方法提出、实验设计、预算分配、证据判断与跨条件验证。只有这些环节共同成立,模型才可能从自动优化走向科学发现。

从研究评测进入模型官方发布

MLS-Bench 还提供 30 题的 MLS-Bench-Lite,覆盖全部 12 个领域,用于更高频的模型迭代。

Kimi K2.7-Code 首先在官方发布中采用该评测;Kimi K3 和 Qwen3.8-Max 随后也将其纳入正式发版表,与软件工程和通用智能体指标并列。

!Image 13: Kimi K3 与 Qwen3.8-Max 官方评测均纳入 MLS-Bench-Lite

Kimi K3 与 Qwen3.8-Max 官方评测均纳入 MLS-Bench-Lite

_图片分别来自 Kimi K3 Tech Blog[4]与 Qwen3.8-Max 官方 Blog[5]。_

传统代码评测逐渐饱和后,AI for Research 正成为新的能力前沿。MLS-Bench 提供的不是一次性排名,而是一套持续测量方法发现与科学判断的基础设施。

对当前系统而言,结论仍然明确:模型已经能够成为高效的工程执行者,却尚未成为能够独立提出、验证并推广新方法的研究者。

#### 引用链接 [1]When AI builds itself:_https://www.anthropic.com/institute/recursive-self-improvement_ [2]Nature 正式论文:_https://www.nature.com/articles/s41586-025-09833-y_ [3]Seed-Prover 论文:_https://arxiv.org/abs/2507.23726_ [4]Kimi K3 Tech Blog:_https://www.kimi.com/blog/kimi-k3_ [5]Qwen3.8-Max 官方 Blog:_https://qwen.ai/blog?id=qwen3.8_

加入青稞AI技术交流群,不仅能与来自MIT、港中文、CMU、UCLA、斯坦福、清华、阿里、腾讯等名校名企AI研究员/开发者一起进行技术交流,同时还有一线青年AI研究员/开发者的Talk分享青稞Tea论文精读招聘内推国内外硕/博申请大模型技术报告解读等。备注:姓名+学校/公司+方向,暗号"AI"优先审核通过!

查看原文 → 發佈: 2026-08-11 00:00:00 收錄: 2026-08-11 04:00:47

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。