← 回總覽

硅星人 Eval Eps.4 | “AI 押中率 98%”?我们让 8 个 AI 押了高考数学卷

📅 2026-06-13 11:24 硅星人Pro 人工智能 2 分鐘 1699 字 評分: 87
AI Agent LLM AI 评测 AI 能力边界 高考数学
📌 一句话摘要 本文通过让 8 个主流 AI Agent 押注 2026 年北京高考数学卷并逐题核对,实证揭示 AI 在密闭预测任务中「形似神不似」——能模仿题型结构,但押中率不足两成,创造新题能力远不及人类。 📝 详细摘要 文章是硅星人 AI 前沿团队「Agent Eval」系列第二期评测。团队将同一份 Prompt 和五年北京高考数学真题发给 ChatGPT、Claude、Gemini、Genspark、GLM、Kimi、MiniMax、Manus 共 8 个 AI Agent,要求它们分析命题规律、预测 2026 年考点并出一套完整模拟卷。评测从五个维度展开:预测逻辑、出卷质量、AI

📌 一句话摘要

本文通过让 8 个主流 AI Agent 押注 2026 年北京高考数学卷并逐题核对,实证揭示 AI 在密闭预测任务中「形似神不似」——能模仿题型结构,但押中率不足两成,创造新题能力远不及人类。

📝 详细摘要

文章是硅星人 AI 前沿团队「Agent Eval」系列第二期评测。团队将同一份 Prompt 和五年北京高考数学真题发给 ChatGPT、Claude、Gemini、Genspark、GLM、Kimi、MiniMax、Manus 共 8 个 AI Agent,要求它们分析命题规律、预测 2026 年考点并出一套完整模拟卷。评测从五个维度展开:预测逻辑、出卷质量、AI 互评(匿名盲评)、PDF 诚实度、考后逐题命中率。结果发现:Genspark 在命中率、亮点分和 AI 互评三项均排第一,但整体命中率仍不足两成;GLM 垫底,出现题号错位、卷面带参考公式等硬伤。文章还揭示了几个意外发现:AI 在匿名盲评中并未表现出「自我偏爱」,反而能准确识别自身短板;面对残缺 PDF 时各家的诚实度差异显著(Kimi 最坦诚,Gemini 凭记忆作答却未主动说明);所有 AI 出题整体偏简单,难度不及高二下学期。核心结论是:AI 能模仿北京卷的「形」(题型、分值分布),但造不出「神」——那道每年翻新的新定义压轴题是集体盲区。

💡 主要观点

- 8 个主流 AI Agent 押注高考数学的命中率均不足两成。 在 21 道真题中,命中知识点最多的 Genspark 也只押中 9 题,且主要集中在固定考点;浮动小题和压轴新定义题几乎全部失手,印证了高考命题「密闭盒子」的特性。

AI 能模仿北京卷的题型结构,但无法创造真正的新题。 所有 AI 都能正确输出 T16 三角、T17 立几、T18 概率等大题骨架,但面对每年翻新的新定义压轴题(T21)集体失语,只会改数字式的拙劣模仿,缺乏知识点组合创新。
匿名盲评中 AI 未表现出「自我偏爱」,反而能准确识别自身短板。 8 个 AI 在匿名互评中,只有 Genspark 把自己排第一(且实至名归),GLM 和 Kimi 主动把自己排到垫底或中下游,说明模型具备一定的自我评估判断力。
AI 面对残缺信息时的诚实度差异显著,是衡量可靠性的关键指标。 Kimi 主动说明只读到三年数据;Gemini 凭记忆作答却未主动交代;GLM 和 MiniMax 虽补全了信息但缺少透明交代。这一维度揭示了 Agent 可靠性的重要差异。
AI 出题整体偏简单,难度不及高二下学期。 一线数学老师审阅后指出,8 套卷普遍偏简单,导数题接近课后练习水平,与高利害医学考试中 AI 命制题目偏简单、偏重低阶认知的研究结论一致。

💬 文章金句

- 8 家几乎都能模仿出北京卷的「形」,却造不出它的「神」。那道每年翻新、逼考生现学现证的新定义压轴题,是全卷的灵魂,也是 AI 集体的盲区。

  • 这批通用 Agent,非但没表现出传说中的自我偏爱,反而有点严于律己。
  • 押得准和出得好,是两回事。

📊 文章信息

AI 初评:87

来源:硅星人Pro

作者:硅星人Pro

分类:人工智能

语言:中文

阅读时间:22 分钟

字数:5326

标签: AI Agent, LLM, AI 评测, AI 能力边界, 高考数学

阅读完整文章

查看原文 → 發佈: 2026-06-13 11:24:00 收錄: 2026-06-13 20:00:12

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。