硅星人团队用同一份 Prompt 测试 8 家主流 Deep Research/Agent 产品预测 Google I/O 2026 Keynote 的能力,基于过程分和结果分进行综合排名,揭示了 Claude 以少而精的策略夺冠、GLM 唯一押中真意外 Gemini Spark、以及押得越多命中率越低等反直觉发现。
📝 详细摘要
本文是硅星人 AI 前沿团队发起的 Agent Eval 系列首期评测报告。团队在 Google I/O 2026 Keynote 前一周,将同一份预测 Prompt 同步发给 Claude、Genspark、ChatGPT、MiniMax、Manus、Gemini、GLM 和 Kimi 共 8 家主流 Deep Research/Agent 产品,要求它们预测 Keynote 发布内容。评测采用过程分(40%)与结果分(60%)加权综合评分,过程分在 Keynote 前锁定,结果分在 Keynote 后逐条对照实际发布清单判定。最终排名为:Claude 第一(70.0 分)、Genspark 第二(66.4 分)、ChatGPT 第三(65.5 分),Kimi 垫底(49.7 分)。报告揭示了三个反直觉发现:过程分最高的 Genspark 未夺冠;唯一押中最大意外 Gemini Spark 的是综合分倒数第二的 GLM;押注数量与命中率成反比(Kimi 押 69 条垫底,Claude 仅押 29 条夺冠)。报告还深入分析了每家 Agent 的信源策略、亮点与槽点,并总结了 8 家 Agent 的集体盲区,包括商业模式变革、全新产品命名、跨产品整合和规模数据预测等方向。
💡 主要观点
- Claude 以少而精的策略夺冠,综合分 70.0。 Claude 仅押 29 条预测,但命中率结构最干净(13 个✅、7 个❌、0 个🚫编造),信源 86%来自 Google 一手源,精准押中多个反共识细节,证明了在预测类任务中少而精优于多而错。
💬 文章金句
- 在我们看来,鼓励「押得少但押得准」,胜过鼓励「押得多但错得多」。
- 用 Deep Research Agent 帮你预测一场发布会,它最擅长的是「已知产品的版本号 + 已知合作伙伴的硬件细节」,最不擅长的是「全新命名 + 商业模式变革 + 跨产品整合」。
- Claude 14 个 URL,86% 都是 Google 官博,可以读为「信源最精挑」,也可以读为「路径最保守」。
- Gemini 最努力,也最尴尬。108 个 URL 全场最多……但长尾博客把整体信源质量拖下来,加上时序错位和自信编造,把「努力」变成了「努力的方向错了」。
📊 文章信息
AI 初评:86
来源:硅星人Pro
作者:硅星人Pro
分类:人工智能
语言:中文
阅读时间:30 分钟
字数:7419
标签: Agent评测, Deep Research, Google I/O, AI Agent, Benchmark