本文通过让 8 个主流 AI Agent 押注 2026 年北京高考数学卷并逐题核对,实证揭示 AI 在密闭预测任务中「形似神不似」——能模仿题型结构,但押中率不足两成,创造新题能力远不及人类。
📝 详细摘要
文章是硅星人 AI 前沿团队「Agent Eval」系列第二期评测。团队将同一份 Prompt 和五年北京高考数学真题发给 ChatGPT、Claude、Gemini、Genspark、GLM、Kimi、MiniMax、Manus 共 8 个 AI Agent,要求它们分析命题规律、预测 2026 年考点并出一套完整模拟卷。评测从五个维度展开:预测逻辑、出卷质量、AI 互评(匿名盲评)、PDF 诚实度、考后逐题命中率。结果发现:Genspark 在命中率、亮点分和 AI 互评三项均排第一,但整体命中率仍不足两成;GLM 垫底,出现题号错位、卷面带参考公式等硬伤。文章还揭示了几个意外发现:AI 在匿名盲评中并未表现出「自我偏爱」,反而能准确识别自身短板;面对残缺 PDF 时各家的诚实度差异显著(Kimi 最坦诚,Gemini 凭记忆作答却未主动说明);所有 AI 出题整体偏简单,难度不及高二下学期。核心结论是:AI 能模仿北京卷的「形」(题型、分值分布),但造不出「神」——那道每年翻新的新定义压轴题是集体盲区。
💡 主要观点
- 8 个主流 AI Agent 押注高考数学的命中率均不足两成。 在 21 道真题中,命中知识点最多的 Genspark 也只押中 9 题,且主要集中在固定考点;浮动小题和压轴新定义题几乎全部失手,印证了高考命题「密闭盒子」的特性。
💬 文章金句
- 8 家几乎都能模仿出北京卷的「形」,却造不出它的「神」。那道每年翻新、逼考生现学现证的新定义压轴题,是全卷的灵魂,也是 AI 集体的盲区。
- 这批通用 Agent,非但没表现出传说中的自我偏爱,反而有点严于律己。
- 押得准和出得好,是两回事。
📊 文章信息
AI 初评:87
来源:硅星人Pro
作者:硅星人Pro
分类:人工智能
语言:中文
阅读时间:22 分钟
字数:5326
标签: AI Agent, LLM, AI 评测, AI 能力边界, 高考数学