全部 未讀 (39041) ★ 收藏 (0) 🤖 人工智能 (14460) 📊 商业科技 (6820) 📁 媒体资讯 (5623) 📁 投资财经 (3499) 📁 生活文化 (2968) 💻 软件编程 (2068) 📁 个人成长 (1991) 📁 体育运动 (1019) 🎨 产品设计 (541) 📁 AI 产品 (39)
篩選中: 🏷️ ProgramBench 共 2 篇 ✕ 清除篩選
39043
全部文章
39041
未讀
58
今日新增
0
收藏
📡 Poller 最後抓取: 34 分鐘前 (08-11 02:00)
BestBlogs 精選 (38970)

🏷️ 熱門標籤

AI Agent 3218 政策解读 1691 投资与市场 1475 宏观经济 1364 AI 编程 1348 产业动态 1309 国际新闻 1214 LLM 1170 Anthropic 1090 社会议题 1064 Claude Code 1041 国内新闻 1022 地缘政治 963 科技新闻 906 OpenAI 899 AI 智能体 788 生活方式 733 个人成长 692 开源 686 足球 685
刷榜 AI 全挂了!Meta 斯坦福地狱级测试,GPT/Claude/Gemini 交出 0 分
📌 一句话摘要 Meta、斯坦福和哈佛联合发布 ProgramBench 基准测试,要求 AI 从零复现完整软件,9 款顶级模型通过率全部为 0%,揭示当前 AI 在系统设计与软件工程能力上的根本性缺陷。 📝 详细摘要 文章报道了由 SWE-Bench 原班人马(Meta、斯坦福、哈佛)联合推出
📅 2026-05-09 00:01 (05-09 00:01) 大模型智能 人工智能 2 分鐘 ★ 85
ProgramBench AI 编程 基准测试 软件工程
0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench 作者新作把 AI 圈干沉默了
📌 一句话摘要 Meta FAIR 联合斯坦福、哈佛发布 ProgramBench 新基准,测试 AI 从零重建完整软件系统的能力,结果 Claude、GPT、Gemini 等顶级模型全部 0% 完成率,暴露了当前 AI 缺乏全局工程规划能力的核心瓶颈。 📝 详细摘要 文章报道了 Meta FA
📅 2026-05-07 10:05 (05-07 10:05) 机器之心 人工智能 1 分鐘 ★ 86
ProgramBench AI 编程 软件工程 基准测试