本文报道 AI Agent 对顶刊论文的复现审计结果:ICML 2026 大部分口头报告论文无法复现,GPT-5 检查显示 99.2%论文至少存在一个客观错误,并探讨 AI 大规模重审科学文献的可能性与局限。
📝 详细摘要
文章围绕 AI Agent 在学术论文复现与审查中的应用展开。研究者对 ICML 2026 全部 168 篇口头报告论文进行复现审计,92 篇拥有至少 5 条可验证结论,其中仅 34 篇能复现超过四成结论,能复现八成以上的只有 8 篇;失败原因包括代码文件缺失、依赖库版本断裂、模型下线等。2025 年底基于 GPT-5 的论文检查系统进一步发现,平均每篇顶刊论文存在 4.7 个客观错误,数学与公式错误占比 54%,99.2%的论文至少被标记一个问题。文章还以浙江实验室研究者 Pios 用 AI 发现约 100 年前的沸点数据错误为例,说明 AI 首次让人们具备大规模重审旧文献的能力。同时作者提醒,AI 核查工具精确率有限、约四成错误漏检,仍需人工审核,并建议学术新人将查错与勘误作为研究方向。
💡 主要观点
- AI Agent 复现审计 ICML 2026 论文,多数结论无法复现。 168 篇口头报告论文中,92 篇有至少 5 条可验证结论,仅 34 篇能复现超四成结论、8 篇能复现八成以上,另有一批因模型下线而永久无法复现。
💬 文章金句
- 或许在今后,论文发表不再意味着研究宣告「胜利」,而只是再次进入了下一轮 AI 验证的开始。
- 一处最初出现在某篇论文中的错误一旦被后续文献反复引用,就会沿着引用链持续传递,形成事实上的学术共识。
- 我们只看「客观错误」,我们不管论文的创新性和研究价值。
- 科学史上的很多重要突破并不来自于提出全新的问题,而来自重新审视一个长期被接受的假设。
📊 文章信息
AI 初评:70
来源:量子位
作者:听雨
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2307
标签: AI Agent, LLM, 论文复现, 学术出版, 科学前沿