Title: Kimi K3、Qwen3.8-Max 官方评测都在用!伯克利硬核测试揭穿 AI 自进化假象 | BestBlogs.dev
URL Source: https://www.bestblogs.dev/article/82adc79ca0?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item
Published Time: 2026-08-11 00:00:00
Markdown Content: !Image 1: MLS-Bench 覆盖 12 个机器学习方向
MLS-Bench 覆盖 12 个机器学习方向
TL;DR
Auto-Research 系统正在快速发展,但当前多数成功案例建立在一个重要前提上:候选方案可以被廉价、快速、明确地验证。只要评分足够便宜,扩大采样与搜索就能持续提高找到好答案的概率。
真实机器学习研究并不总具备这个条件。完整训练昂贵,反馈存在延迟,单次实验只能提供部分证据。系统不仅要提出候选方法,还要判断什么假设值得验证、如何用有限预算组织实验,以及一个局部增益能否跨数据和规模成立。 MLS-Bench将这一问题构造成 12 个领域、140 个真实研究任务。它通过控制可修改范围、统一复现强人类方法,并在至少三个测试条件中检查迁移能力,将目标算法贡献与调参、容量和实现技巧分开。
实验分析显示,即使获得强基线代码并进行多轮实验,模型仍更擅长优化和组合已有组件,而不是发现新的机制;在更自由的算力分配实验中,它们也没有表现出可靠的实验规划与证据判断能力。
论文:https://arxiv.org/abs/2605.08678 项目主页:https://mls-bench.com/ 代码:https://github.com/Imbernoulli/MLS-Bench!Image 2: MLS-Bench 论文首页
「自进化」正在同时指向几种不同能力
讨论 MLS-Bench 之前,需要先拆开当前「self-evolving AI」叙事中的几种目标。
第一层是执行能力。模型从生成代码片段,发展到能够进入仓库、运行命令、调用工具并完成长程任务。Anthropic 的内部数据记录了这种变化:Claude Code 在开放式问题上的会话成功率快速上升,Claude 编写的代码也已经占到其合并代码的 80% 以上。
!Image 3: Claude Code 在不同复杂度任务上的成功率变化
Claude Code 在不同复杂度任务上的成功率变化
_图片来自 Anthropic 的 When AI builds itself[1]。该图衡量的是内部编程会话,并不等价于方法发现。_
第二层是系统外围的持续更新。模型可以创建和复用技能、维护记忆、修改工具链,或参与数据构建与训练流程。MiniMax M2.7 将模型创建强化学习技能、更新记忆并优化自身学习过程称为模型自我进化,就是这一方向的代表。
第三层才是研究产物本身:系统能否提出一个此前不存在、而且比人类已有方案更好的方法。
前两层可以显著提高研发效率,也会成为第三层的重要基础,但三者不能直接等同。一个 Agent 可以写出大量训练代码,仍然只是更高效地执行人类给定的研究方向。
Richard Sutton 在《苦涩的教训》中给出了更高的目标:真正长期有效的往往是能够利用更多计算的通用方法;我们最终需要的是能完成发现过程的 Agent,而不只是包含人类已有发现的系统。
因此,Auto-Research 的关键问题不只是「AI 是否参与了 AI 研发」,而是它能否发现具有迁移性、并能随数据与计算继续发挥作用的方法。ResNet、Transformer、扩散模型、RMSNorm 与 PPO 之所以推动机器学习发展,正是因为它们超越了单个实例。
问题不在于能否执行研究,而在于能否归因方法进步
围绕自进化 Agent 的讨论中,「系统完成了多少研究步骤」经常被用来衡量能力。一个完整系统可以检索文献、生成想法、修改代码、运行实验,再根据结果继续迭代。
但研究流程的覆盖程度,与方法发现能力并不等价。
假设某个候选提交获得了更高分,增益可能来自四类不同因素:
- 1. 目标算法组件发生了有效变化;
- 2. 超参数和训练日程被更充分地搜索;
- 3. 数据、模型容量或计算预算发生了变化;
- 4. 系统利用了评分流程或测试条件中的捷径。
这一区分在廉价验证任务中不一定重要。对于 circle packing、kernel 优化或固定训练 speedrun,目标本身就是在明确约束下找到更高分的候选,任何合法路径都可以被接受。大规模搜索因此是合理的核心机制。
方法发现面对的是另一种目标。一个有价值的机器学习方法,通常需要在数据、模型、环境或规模发生变化后继续有效。它不仅要提高指标,还应捕捉一个比当前实例更一般的问题结构。
MLS-Bench 的核心贡献,是为这种方法级进步建立可执行、可归因的测试环境。
任务设计:140 个研究问题,12 个领域
MLS-Bench 覆盖语言模型预训练与后训练、视觉生成、强化学习、机器人、机器学习系统、AI for Science、优化与理论、因果推断、时间序列与可信学习等 12 个方向,共包含 140 个任务。
具体任务包括 KV 缓存压缩、主动学习、时空交通预测、黑洞图像逆问题、抗体与抗原结合、机器人世界模型、训练量化以及优化与理论问题。这样的覆盖不仅增加题目数量,也把不同研究社区对「有效方法」的判断引入同一评测。
完整评测只运行每题一个候选方案,约需 700 个 H100 小时。覆盖全部 12 个领域的 30 题 MLS-Bench-Lite,单次评测仍约需 90 个 H100 小时。若允许 Agent 在提交前探索多个候选,实际成本还会继续增加。这种成本不是额外包装,而是执行真实训练与跨条件验证的直接结果。
每个任务来自真实代码库,并围绕一个具体研究组件构造。模型可能需要改进训练目标、优化器、注意力机制、采样策略或路由规则。提交形式不是文本答案,而是能够在给定代码库中训练和评测的实现。
!Image 4: MLS-Bench 从固定实例优化转向方法级发现
MLS-Bench 从固定实例优化转向方法级发现
_单个实例上的分数提升不足以证明方法成立,候选提交还需要跨条件验证。_
每项任务都包含:
* • 具体研究问题与真实代码库;
* • 经过领域专家校准的可修改组件;
* • 至少三个用于检验迁移能力的测试条件;
* • 至少三种强人类基线,其中包含领域公认的 SOTA;
* • 在统一代码库、训练协议和评分流程中复现的基线结果。
这些要素共同服务于两个目标:控制增益来源,以及检查方法的可推广性。
为什么必须重新实现强人类基线
很多评测直接引用论文报告的基线数字,但不同方法往往使用不同代码、数据版本、训练预算与实现细节。将这些数字放在一张表中,并不能形成严格对照。
MLS-Bench 要求每个任务至少复现三种强人类方法。复现结果首先用于建立统一参考,也用于反向校准可修改范围。
如果公认的最佳方法无法在指定组件内实现,说明限制过窄,评测可能排除真实创新;如果不修改目标组件也能通过其他路径显著提分,说明限制过宽,算法贡献无法归因。
最终形成的边界需要同时满足两点:
* • 表达能力足以容纳当前强方法;
* • 模型无法修改目标研究问题以外的环节。
可行性还涉及训练规模。对于原始成本过高的任务,团队会使用较小模型或较少数据,但要求所有强人类方法在缩小规模后保持原有性能排序。缩小后的实验如果改变了方法之间的相对优劣,就不能作为原问题的有效代理。140 个任务都要经过这项校准。
MLS-Bench 的受控研究过程
_强人类方法与模型提交在相同代码和训练流程中比较。_
例如,研究训练目标时,数据管线、评分器和共享训练流程保持不变;研究结构时,评测会检查参数规模,避免候选通过增加容量获得优势。对不同任务,测试条件会改变数据集、模型、环境或规模,以检验一个局部改动能否迁移。
由于不同领域包含不同条件和指标,论文使用三级聚合得到统一分数。每个原始指标先以复现的人类基线为锚点进行变换,最弱基线对应 0 分,最强基线对应 50 分;随后在测试条件内聚合,再形成任务级分数。存在理论上界的指标仍保留超过 50 分的空间。
这套设计实际上将研究评测转换成一种受控实验:只允许目标算法变量发生变化,再观察变化能否在多个条件中产生一致收益。
主实验:多轮迭代提高分数,但不等于方法发现
主实验评测五个前沿模型,并提供两种运行方式。
第一种评估模型首次提出并实现的方案;第二种允许模型进入代码库,多轮运行实验、读取反馈和修改实现。
每个模型还会获得强基线代码,包括当前公认的最佳方法。因此,这里不主要考查文献复现或代码重建,而是考查模型能否在强方法之上继续进行方法发现。
不同领域中的模型与复现方法表现
_网页柱状图按领域对比模型首次方案、多轮实验结果与 Human SOTA。_
论文主实验中,多轮实验能够提高模型得分,但当时评测的五个模型所提出的方法在整体表现上均未超过 Human SOTA。随着后续更强模型进入公开榜单,汇总成绩仍在继续上涨。不过,当前领先成绩的绝对水平依然不高,评测远未饱和。与此同时,总分是否越过某个基线锚点,也不是判断方法创新的充分条件。
更有诊断意义的是候选方法的组成与跨条件行为。对论文初版五个模型的消融和专家分析显示,模型的提升主要来自已有组件的调优与重组,新的方法机制仍然少见。
参数规模检查的控制实验展示了为什么这些限制不可省略。移除检查后,所有模型都会通过扩大参数量获得收益,部分结果可以超过人类基线;恢复检查后,这些表面提升消失。若只观察最终分数,这类容量增长很容易被错误归因成算法创新。
重要的是,这个结果并非来自工具调用失败。模型能够修改代码、启动训练并根据结果迭代。主要差距出现在候选方法本身:模型很少提出具有新机制、并能在多个条件下持续成立的改进。
提示消融与专家分析:优化能力强于发现能力
研究团队通过提示消融区分模型的两种行为。
当任务目标更偏向「优化现有方法」时,模型表现更好;当目标要求「发现一种新方法」时,结果更弱。这说明当前 Agent 更适合在已有方向上进行局部工程搜索。
专家案例分析进一步检查了候选方案的组成。模型经常从多个基线中抽取损失、模块与训练策略,再进行重组和参数调整。这样的方案可以产生局部收益,但真正新的机制很少;即使模型提出了新结构,也往往缺少一个能够解释其有效性并指导跨条件验证的有洞见假设。
模型提交与强基线的关系
_模型方案通常贴近已经提供的基线组件。_
这里需要区分「新组合」与「新方法」。前者可以在特定系统中具有工程价值;后者则要求对已有方法的局限给出新的解释,并由可迁移实验支持。MLS-Bench 测到的主要瓶颈,正是从前者走向后者的能力。
测试时扩展为什么没有跨过这条边界
对于可自动验证任务,一个自然方案是增加迭代与采样量。
MLS-Bench 的测试时扩展实验确认,更多尝试通常能够提高分数,但收益很快饱和,尤其是在更困难的研究任务中。
测试时扩展的收益与上限
_增加迭代和采样能够改善局部结果,但收益会逐渐饱和。_
当模型只能看到部分测试反馈时,继续搜索还可能造成另一个问题:候选方案更适应可见条件,却在未开放条件中退化。这是方法发现与固定目标优化之间的直接区别。
大规模采样可以更充分地搜索一个已经定义的候选空间,但真正的方法发现往往需要重新定义空间。模型要先识别现有方法为何失败,形成一个有解释力的假设,再决定什么候选值得进入实验。采样量本身不能提供这一判断。
预训练实验:更多算力选项没有带来更好的研究决策
方法提出只是科学工作的一部分。研究者还需要在有限资源下选择实验,并根据不完整反馈更新假设。
论文构造了一个受算力约束的真实预训练环境。固定流程原本允许三次完整的 345M 参数训练;新的实验将前两次完整训练转换为自适应预算,由模型自行决定代理模型规模、训练 token 数和实验顺序。
这个设计让模型有机会执行常见的研究策略:先运行便宜的小实验,比较多个假设,再把昂贵的完整训练用于最有希望的方向。
结果并未显示出稳定优势。更多可选实验经常导致更差结果。一个模型积极消耗预算,最终性能下降;唯一取得提升的模型只使用了很少算力。
模型自主安排预训练实验预算
_灵活预算测试的是实验价值判断,而不只是代码执行。_
模型在这里缺少的不只是一个更好的候选方法,还包括:
* • 选择能够区分多种解释的代理实验;
* • 判断小规模结果是否能够外推;
* • 根据新证据放弃或修正假设;
* • 决定何时值得进行昂贵验证。
团队还加入网页搜索、基线论文推导和相关理论背景。整体增益仍然有限,很多情况下与普通多轮迭代接近。
额外上下文带来的增益有限
_信息获取不是唯一瓶颈,关键还在于如何将知识转化为假设和证据。_
因此,当前模型不仅弱于提出新方法,也缺少建立与验证证据所需的、更广泛的科学判断力。
从可规模化搜索到可规模化科学发现
今天的自动发现范式来自一条连续技术路径。
AlphaGo 与 AlphaZero 在规则明确的博弈中结合模型与树搜索;AlphaTensor 将数学问题转换为可搜索的动作空间;FunSearch 让语言模型生成代码候选,并由自动评分器筛选;AlphaEvolve 进一步把候选扩展到完整程序,通过程序库、评分器和迭代生成形成进化循环。
这条路径不断扩大「可以搜索的对象」,但始终保留一个核心条件:验证必须足够快、足够明确,才能支撑大量候选的生成与淘汰。
形式化数学处在一个有意思的中间位置。Lean 编译器可以给出严格反馈,验证成本又高于简单数值函数。AlphaProof 一类系统可以围绕形式化状态进行广泛树搜索,Seed-Prover 一类方法则更多依赖强模型生成整段证明,再对失败局部进行修正。
!Image 11: AlphaProof 式的策略采样与证明树搜索
AlphaProof 式的策略采样与证明树搜索
_AlphaProof 使用证明网络为策略采样和树搜索提供引导。图源:Nature 正式论文[2]。_
!Image 12: Seed-Prover 的整段证明与分层修正过程
Seed-Prover 的整段证明与分层修正过程
_Seed-Prover 从整段证明生成出发,并在更高预算下利用 Lean 反馈逐层修正失败引理。图源:Seed-Prover 论文[3]。_
同一个领域能够同时容纳深搜索和更强模型推理,说明搜索并非错误路线。真正决定系统形态的是候选生成成本与验证成本之间的比例。
现有自进化系统的许多成功案例依赖廉价验证器。每个候选都能快速得到明确反馈,系统可以通过大规模采样近似换取更高成功率。
真实科学发现的约束恰好不同。验证可能昂贵、延迟、多阶段且只能部分观察。一次实验通常不能直接判定一个假设;系统需要通过多个代理实验逐步缩小解释空间,再决定是否投入更大预算。
因此,真正稀缺的资源不是候选数量,而是能够产生有效信息的计算。论文将这一问题概括为:在验证难以规模化的条件下,实现可规模化的科学发现。
这也意味着 Auto-Research 不能只沿着「更长循环、更多采样」扩展。完整能力至少包括方法提出、实验设计、预算分配、证据判断与跨条件验证。只有这些环节共同成立,模型才可能从自动优化走向科学发现。
从研究评测进入模型官方发布
MLS-Bench 还提供 30 题的 MLS-Bench-Lite,覆盖全部 12 个领域,用于更高频的模型迭代。
Kimi K2.7-Code 首先在官方发布中采用该评测;Kimi K3 和 Qwen3.8-Max 随后也将其纳入正式发版表,与软件工程和通用智能体指标并列。
!Image 13: Kimi K3 与 Qwen3.8-Max 官方评测均纳入 MLS-Bench-Lite
Kimi K3 与 Qwen3.8-Max 官方评测均纳入 MLS-Bench-Lite
_图片分别来自 Kimi K3 Tech Blog[4]与 Qwen3.8-Max 官方 Blog[5]。_
传统代码评测逐渐饱和后,AI for Research 正成为新的能力前沿。MLS-Bench 提供的不是一次性排名,而是一套持续测量方法发现与科学判断的基础设施。
对当前系统而言,结论仍然明确:模型已经能够成为高效的工程执行者,却尚未成为能够独立提出、验证并推广新方法的研究者。
#### 引用链接
[1]When AI builds itself:_https://www.anthropic.com/institute/recursive-self-improvement_
[2]Nature 正式论文:_https://www.nature.com/articles/s41586-025-09833-y_
[3]Seed-Prover 论文:_https://arxiv.org/abs/2507.23726_
[4]Kimi K3 Tech Blog:_https://www.kimi.com/blog/kimi-k3_
[5]Qwen3.8-Max 官方 Blog:_https://qwen.ai/blog?id=qwen3.8_
加入青稞AI技术交流群,不仅能与来自MIT、港中文、CMU、UCLA、斯坦福、清华、阿里、腾讯等名校名企AI研究员/开发者一起进行技术交流,同时还有一线青年AI研究员/开发者的Talk分享、青稞Tea、论文精读、招聘内推、国内外硕/博申请、大模型技术报告解读等。备注:姓名+学校/公司+方向,暗号"AI"优先审核通过!