← 回總覽

硅星人 Eval Eps.1 | 8 家通用 Agent 预测 Google I/O keynote,结果出人意料

📅 2026-05-22 09:43 硅星人Pro 人工智能 2 分鐘 2004 字 評分: 86
Agent评测 Deep Research Google I/O AI Agent Benchmark
📌 一句话摘要 硅星人团队用同一份 Prompt 测试 8 家主流 Deep Research/Agent 产品预测 Google I/O 2026 Keynote 的能力,基于过程分和结果分进行综合排名,揭示了 Claude 以少而精的策略夺冠、GLM 唯一押中真意外 Gemini Spark、以及押得越多命中率越低等反直觉发现。 📝 详细摘要 本文是硅星人 AI 前沿团队发起的 Agent Eval 系列首期评测报告。团队在 Google I/O 2026 Keynote 前一周,将同一份预测 Prompt 同步发给 Claude、Genspark、ChatGPT、MiniMax、Ma

📌 一句话摘要

硅星人团队用同一份 Prompt 测试 8 家主流 Deep Research/Agent 产品预测 Google I/O 2026 Keynote 的能力,基于过程分和结果分进行综合排名,揭示了 Claude 以少而精的策略夺冠、GLM 唯一押中真意外 Gemini Spark、以及押得越多命中率越低等反直觉发现。

📝 详细摘要

本文是硅星人 AI 前沿团队发起的 Agent Eval 系列首期评测报告。团队在 Google I/O 2026 Keynote 前一周,将同一份预测 Prompt 同步发给 Claude、Genspark、ChatGPT、MiniMax、Manus、Gemini、GLM 和 Kimi 共 8 家主流 Deep Research/Agent 产品,要求它们预测 Keynote 发布内容。评测采用过程分(40%)与结果分(60%)加权综合评分,过程分在 Keynote 前锁定,结果分在 Keynote 后逐条对照实际发布清单判定。最终排名为:Claude 第一(70.0 分)、Genspark 第二(66.4 分)、ChatGPT 第三(65.5 分),Kimi 垫底(49.7 分)。报告揭示了三个反直觉发现:过程分最高的 Genspark 未夺冠;唯一押中最大意外 Gemini Spark 的是综合分倒数第二的 GLM;押注数量与命中率成反比(Kimi 押 69 条垫底,Claude 仅押 29 条夺冠)。报告还深入分析了每家 Agent 的信源策略、亮点与槽点,并总结了 8 家 Agent 的集体盲区,包括商业模式变革、全新产品命名、跨产品整合和规模数据预测等方向。

💡 主要观点

- Claude 以少而精的策略夺冠,综合分 70.0。 Claude 仅押 29 条预测,但命中率结构最干净(13 个✅、7 个❌、0 个🚫编造),信源 86%来自 Google 一手源,精准押中多个反共识细节,证明了在预测类任务中少而精优于多而错。

GLM 是唯一押中最大意外 Gemini Spark 的 Agent,但综合分仅排倒数第二。 GLM 在追问 3 中通过拼凑 Play Store 泄露代号 COSMO、Remy 描述和 Android Show 信号推理出 Spark,但主报告未包含此预测,且大量押注已发生事件,导致综合分被拉低。
押注数量与命中率成反比,Kimi 和 Manus 押得最多但排名垫底。 Kimi 押 69 条、Manus 押 72 条,大量 Android 17 平台 API 预测在 Keynote 主台未出现,导致分母过大、命中率被拉低。评测算法奖励精准押注而非密集列点。
8 家 Agent 在商业模式变革、全新命名和跨产品整合方向集体翻车。 Agent 擅长预测已知产品的版本号和硬件细节,但无法预测 AI Ultra 降价改计费、Google Pics 等全新命名、Universal Cart 等跨产品整合,以及 Personal Intelligence 的规模数据。

💬 文章金句

- 在我们看来,鼓励「押得少但押得准」,胜过鼓励「押得多但错得多」。

  • 用 Deep Research Agent 帮你预测一场发布会,它最擅长的是「已知产品的版本号 + 已知合作伙伴的硬件细节」,最不擅长的是「全新命名 + 商业模式变革 + 跨产品整合」。
  • Claude 14 个 URL,86% 都是 Google 官博,可以读为「信源最精挑」,也可以读为「路径最保守」。
  • Gemini 最努力,也最尴尬。108 个 URL 全场最多……但长尾博客把整体信源质量拖下来,加上时序错位和自信编造,把「努力」变成了「努力的方向错了」。

📊 文章信息

AI 初评:86

来源:硅星人Pro

作者:硅星人Pro

分类:人工智能

语言:中文

阅读时间:30 分钟

字数:7419

标签: Agent评测, Deep Research, Google I/O, AI Agent, Benchmark

阅读完整文章

查看原文 → 發佈: 2026-05-22 09:43:00 收錄: 2026-05-22 18:00:44

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。