← 回總覽

AI 能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

📅 2026-07-31 19:07 新智元 人工智能 8 分鐘 9538 字 評分: 83
人工智能 科学研究 机器人实验室 大语言模型 实验自动化
📌 一句话摘要 文章报道中国科大构建机器科学家实验平台,评测多种 LLM 智能体在真实物理实验中的执行能力,揭示当前 AI 仍远离真正的自主科学发现。 📝 详细摘要 文章介绍中国科学技术大学最新研究:搭建了包含 45 个模块化自动工作站的机器催化实验室,将实验能力封装为机器可读技能,使 AI 智能体能够直接调用设备并受真实设备约束。研究团队对 6 种智能体框架与 9 种大语言模型的 48 种组合进行了 4,608 次测试,覆盖 32 项领域专家定义的研究任务。结果显示,仅 3.3%的工作流能无需人工修复直接执行,表现最好的 Claude Code+Claude Opus 4.7 组合可执行

83

The article reports that USTC has built a machine‑scientist experimental platform to evaluate the execution ability of various LLM agents in real‑world physics experiments, revealing that current AI remains far from true autonomous scientific discovery. ![Image 1: 新智元新智元](https://www.bestblogs.dev/articles?sourceid=1d8c20 "View More From This Source")

Yesterday 1659 words (about 7 min) View Source →

Sign in to highlight text and take notes as you read. Sign in now

新智元 2026-07-31 19:07 北京

!Image 2

!Image 3

新智元报道

!Image 4 我们如何判断人工智能是否已经足够聪明,能够从事科学研究,实现端到端的自主科学发现? 中国科学技术大学发布的最新研究让AI「大脑」接管机器科学家实验室「身体」,由此将这一问题从知识问答和方案生成,推进到真实物理世界中的实验执行与反馈学习。

!Image 5

论文链接:https://arxiv.org/abs/2607.23045

研究团队搭建了一个机器催化实验室,其中包括45个覆盖合成、表征和催化性能测试的模块化自动工作站。

为了让AI理解和调用实验室能力,研究团队将这些能力封装为机器可读技能(skills)。AI智能体可以通过这些技能直接调用实验设备,同时接受真实设备能力、操作规范和实验条件的约束。

!Image 6

图1.用于催化研究的AI读得懂的机器科学家实验室架构。

!Image 7

图2.从科学意图到机器实验室执行路径。

!Image 8 压力测试

基于该平台,研究团队对由6种智能体框架和9种大语言模型构成的48种实际配置进行了系统评测。

测试覆盖32项由领域专家定义的研究任务,共计4,608次评测试次。评估不仅考察智能体能否生成实验计划,还追踪这些计划能否通过核验并下发至机器人系统,以及生成的工作流是否能够在无需人工干预的情况下直接执行。 残酷的真实世界评测结果

当前领先的大语言模型智能体距离「接管」仍有明显差距。在4,608次测试中,仅151个工作流无需人工修复即可执行,占全部测试的3.3%。表现最好的Claude Code与Claude Opus 4.7组合,可执行率为28.1%;Codex与GPT 5.5组合的可执行率为19.8%。 会调整参数,不等于会重新规划

研究还进一步考察了智能体能否从真实实验结果中学习。团队将Codex/GPT 5.5的组合置于一个开放式的五轮闭环中,连续开展实验规划、机器人执行、证据获取和重新规划。

智能体能够根据返回的实验结果调整材料配方和操作条件,但这些调整主要停留在局部参数优化层面。

在五轮实验过程中,智能体始终保留原有的工作流骨架,没有重新设计分析方法,也未能纠正一些持续存在的关键遗漏,例如缺少电极黏结剂和针对特定分析物的显色试剂。

结果表明,能够读取实验反馈并调整参数,并不等同于能够识别研究策略本身的问题,更不等同于进行科学层面的重新规划。

!Image 9

图3.AI智能体在可执行规划、验证和实验室任务下发各环节的表现。 长程规划仍然是瓶颈

虽然部分智能体生成了经专家评估可执行、且最多包含44个操作步骤的工作流,但在全部测试中,只有3个工作流超过30个操作步骤。这表明,随着任务链条延长,智能体维持实验逻辑完整性和物理可执行性的能力仍面临显著挑战。

重新定义AI的科学能力

研究由此区分了当前「AI科学家」讨论中经常被混为一谈的三种能力:一是流畅地生成实验计划,二是生成能够在物理实验室中实际执行的工作流,三是根据实验结果调整整体研究策略。

研究结果显示,语言层面的规划能力并不能自动转化为可靠的实验执行能力,局部参数调整也不能被直接视为科学层面的重新规划。

!Image 10 从「AI测试场」走向「AI训练场」

作为AI for Science的智能科研基础设施,机器实验室既可以成为检验AI科学能力的「测试场」,也可以成为推动AI持续进化的「训练场」。AI智能体通过机器可读技能与机器实验室直接对话,将科学意图转化为可执行任务,并接收来自机器执行、仪器状态和实验结果的真实反馈。

由此形成的「规划—执行—反馈—重新规划」闭环,不仅能够暴露AI在知识、操作和研究策略层面的缺陷,还可以将成功的工作流、失败案例、实验结果和专家评估沉淀为模型训练与智能体对齐的数据,持续迭代AI模型及其智能体系统。

机器科学家由此为回答「我们如何判断人工智能是否已经足够聪明,能够从事科学研究?」提供可量化、可重复、可验证的物理世界证据,并推动AI从生成实验方案,逐步走向涵盖科学问题提出、实验设计、机器人执行、数据分析和证据驱动重新规划的端到端自主科学发现。

!Image 11

图4.开放科学问题下AI-机器科学家的五轮迭代。

参考资料: https://arxiv.org/abs/2607.23045

编辑:LRST 秒追ASI 点赞、转发、在看一键三连 点亮星标,锁定新智元极速推送!

!Image 12

!Image 13

Key Quotes

> Current leading LLM agents still have a noticeable gap from “taking over.” In the 4,608 tests, only 151 workflows could be executed without human intervention, accounting for 3.3% of all tests. The best‑performing Claude Code + Claude Opus 4.7 combination achieved an executability rate of 28.1%, while the Codex + GPT‑5.5 combination reached 19.8%.

> Agents can adjust material formulations and operating conditions based on returned experimental results, but these adjustments mainly remain at the local‑parameter optimization level. Throughout the five‑round experiments, agents retained the original workflow skeleton, did not redesign the analysis method, and failed to correct persistent critical omissions such as missing electrode binder and color‑development reagents for specific analytes.

> This research distinguishes three capabilities often conflated in discussions of an “AI scientist”: (1) fluently generating experimental plans, (2) generating workflows that can actually be executed in a physical lab, and (3) adjusting overall research strategy based on experimental results.

Tags

Artificial Intelligence

Scientific Research

Robotics Laboratory

Large Language Models

Experiment Automation

Related Articles

* 145. Oral History of SpaceX Development: Former Executive Lewis Hong on Musk's Hiring Philosophy, the Biggest IPO, Space & AI, and Prelude to Human Civilization Expansion? * Wang Jianshuo: Markdown is the New Programming Language * From Today, ChatGPT and OpenClaw Are One! Codex Launches "Virtual Pet" Feature, Coders Can't Sleep * Revaluing Everything, Renaissance - 2026H1 AI Industry Observation * AutoResearch-LLM: Letting Agents Take Over LLM Training Optimization, validates it on 1688 e-commerce tasks, and provides a reusable methodology from theory to engineering.") * New Work from the Father of Modern AI: Testing 13 Large Models, Is the Retrieval Agent Really Trustworthy? * Is Your AI Agent Getting Dumber Over Time? CUHK and Zhejiang University Debunk the "Memory" Myth * AI and Careers Over the Last Three Years: Turbulence, Patterns, and Professional Portraits * Browser Turns into a Phone! CAS Open-Sources Agent Training Ground, WeChat and Genshin Impact Can Run * Science | Peking University Develops the World’s First Controllable In-Memory Computing Memristor Neural Dynamics Chip

查看原文 → 發佈: 2026-07-31 19:07:00 收錄: 2026-08-01 02:00:07

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。