百度文心助手任务 Agent 在 PinchBench v2 基准测试中以 94.6% 的最高分夺冠,超越 Claude、GPT 等国际顶尖模型,展示了其在复杂任务中的端到端执行能力。
📝 详细摘要
文章报道百度文心助手任务 Agent 在全球工程向 AI 智能体评测榜单 PinchBench v2 中夺冠,得分 94.6%,领先 Claude Opus 4.8-fast(93.5%)、通义千问 Qwen3.7-max(92.5%)等模型。文章详细介绍了 PinchBench 的评测理念——侧重智能体能否完整完成任务并交付可验证结果,而非仅考模型知识。文中列举了多个真实工作场景任务(如财务利润率计算、安全漏洞分析、合同法律分析等),展示了 Agent 在文件创建、指标定位、计算结论等维度上的满分表现。文章进一步分析了百度为何能取得这一成绩,指出其长期在搜索引擎意图理解和工具链积累使得多智能体框架能够显著释放模型潜力。最后提到相关评测流程已在 GitHub 开源,技术已集成到百度 App 与文心助手中,用户可直接体验。
💡 主要观点
- PinchBench 评测注重智能体端到端任务完成能力,区别于传统仅考模型知识的基准。 文章指出传统基准如 MMLU、GPQA 考察模型知不知道,而 PinchBench 考察智能体能否把整件事做完并交付可验证结果,采用自动化校验+LLM 评审双轨机制,全程无人工干预。
💬 文章金句
- PinchBench 由 Kilo AI 推出,OpenClaw 社区维护。它和 MMLU、GPQA 这类传统大模型基准的区别很直接:传统基准考「模型知不知道」,PinchBench 考「智能体能不能把整件事做完并交付可验证的结果」。
- 比如其中一个任务是:「GitLab Q3 2025 财季的实际利润率与指引之间差了多少个基点?」没有给任何数据文件,Agent 需要自主检索 GitLab 财报原文或电话会议记录,定位相关指引,计算出非 GAAP 运营利润率约 18%、超出指引约 500 个基点,并将结论写入指定文件。
- 文心助手任务 Agent 依托百度搜索猎户座 AI 引擎的多智能体框架构建。从架构逻辑来看,搜索引擎本身就是最早的 Agent 雏形------接收意图、拆解任务、调用工具、验证结果,这条链路百度已经跑了二十余年。
📊 文章信息
AI 初评:78
来源:量子位
作者:量子位的朋友们
分类:人工智能
语言:中文
阅读时间:8 分钟
字数:1825
标签: 人工智能, AI Agent, 基准测试, 百度, 量子位