ARTICLE · 人工智能

AI 能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

作者:新智元 来源:新智元 2026-07-31 19:07 7 分钟 11 阅读 1659 字
人工智能科学研究机器人实验室大语言模型实验自动化
一语总结

文章报道中国科大构建机器科学家实验平台,评测多种 LLM 智能体在真实物理实验中的执行能力,揭示当前 AI 仍远离真正的自主科学发现。

AI 总结

文章介绍中国科学技术大学最新研究:搭建了包含 45 个模块化自动工作站的机器催化实验室,将实验能力封装为机器可读技能,使 AI 智能体能够直接调用设备并受真实设备约束。研究团队对 6 种智能体框架与 9 种大语言模型的 48 种组合进行了 4,608 次测试,覆盖 32 项领域专家定义的研究任务。结果显示,仅 3.3%的工作流能无需人工修复直接执行,表现最好的 Claude Code+Claude Opus 4.7 组合可执行率为 28.1%,Codex+GPT 5.5 组合为 19.8%。进一步的五轮闭环实验表明,智能体能根据实验结果调整局部参数,但未能重新设计工作流或纠正关键遗漏,说明局部参数优化不等同于科学层面的重新规划。文章指出,当前 AI 在生成可执行工作流和根据反馈进行全局策略调整方面仍存在显著瓶颈,机器实验室可作为测试与训练场,推动 AI 从生成实验方案迈向端到端的自主科学发现。

核心要点
  1. 构建机器科学家实验室,将实验能力封装为机器可读技能。

    研究团队在 USTC 搭建了 45 个覆盖合成、表征和催化性能测试的模块化自动工作站,并将其能力封装为 skills,使 AI 智能体能够直接调用设备并受真实设备约束。

  2. 当前 LLM 智能体在真实实验中的可执行率极低。

    在 4,608 次测试中仅 151 个工作流无需人工修复即可执行(3.3%),表现最好的 Claude Code+Claude Opus 4.7 组合可执行率为 28.1%,Codex+GPT 5.5 组合为 19.8%。

  3. 在五轮闭环实验中,智能体根据实验结果调整材料配方和操作条件,但始终保留原有工作流骨架,未重新设计分析方法,也未纠正如缺少电极黏结剂等关键遗漏。

  4. 长程规划是当前 AI 科学家的主要瓶颈。

    尽管部分智能体生成了经专家评估可执行且最多含 44 个操作步骤的工作流,但在全部测试中只有 3 个工作流超过 30 步,表明在长链条任务上维持实验逻辑和物理可执行性仍然困难。

AI 能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

文章介绍中国科学技术大学最新研究:搭建了包含 45 个模块化自动工作站的机器催化实验室,将实验能力封装为机器可读技能,使 AI 智能体能够直接调用设备并受真实设备约束。研究团队对 6 种智能体框架与 9 种大语言模型的 48 种组合进行了 4,608 次测试,覆盖 32 项领域专家定义的研究任务。结果显示,仅 3.3%的工作流能无需人工修复直接执行,表现最好的 Claude Code+Claude Opus 4.7 组合可执行率为 28.1%,Codex+GPT 5.5 组合为 19.8%。进一步的五轮闭环实验表明,智能体能根据实验结果调整局部参数,但未能重新设计工作流或纠正关键遗漏,说明局部参数优化不等同于科学层面的重新规划。文章指出,当前 AI 在生成可执行工作流和根据反馈进行全局策略调整方面仍存在显著瓶颈,机器实验室可作为测试与训练场,推动 AI 从生成实验方案迈向端到端的自主科学发现。

文章金句

"

当前领先的大语言模型智能体距离「接管」仍有明显差距。在 4,608 次测试中,仅 151 个工作流无需人工修复即可执行,占全部测试的 3.3%。表现最好的 Claude Code 与 Claude Opus 4.7 组合,可执行率为 28.1%;Codex 与 GPT 5.5 组合的可执行率为 19.8%。

"

智能体能够根据返回的实验结果调整材料配方和操作条件,但这些调整主要停留在局部参数优化层面。在五轮实验过程中,智能体始终保留原有的工作流骨架,没有重新设计分析方法,也未能纠正一些持续存在的关键遗漏,例如缺少电极黏结剂和针对特定分析物的显色试剂。

"

研究由此区分了当前「AI 科学家」讨论中经常被混为一谈的三种能力:一是流畅地生成实验计划,二是生成能够在物理实验室中实际执行的工作流,三是根据实验结果调整整体研究策略。