SuperPortia Reading
總覽
文章
簡報
🔍 搜尋
全部
未讀 (39041)
★ 收藏 (0)
🤖 人工智能 (14460)
📊 商业科技 (6820)
📁 媒体资讯 (5623)
📁 投资财经 (3499)
📁 生活文化 (2968)
💻 软件编程 (2068)
📁 个人成长 (1991)
📁 体育运动 (1019)
🎨 产品设计 (541)
📁 AI 产品 (39)
篩選中:
🏷️ ProgramBench
共 2 篇
✕ 清除篩選
39043
全部文章
39041
未讀
58
今日新增
0
收藏
📡 Poller
最後抓取:
34 分鐘前
(08-11 02:00)
BestBlogs 精選 (38970)
🏷️ 熱門標籤
AI Agent
3218
政策解读
1691
投资与市场
1475
宏观经济
1364
AI 编程
1348
产业动态
1309
国际新闻
1214
LLM
1170
Anthropic
1090
社会议题
1064
Claude Code
1041
国内新闻
1022
地缘政治
963
科技新闻
906
OpenAI
899
AI 智能体
788
生活方式
733
个人成长
692
开源
686
足球
685
●
刷榜 AI 全挂了!Meta 斯坦福地狱级测试,GPT/Claude/Gemini 交出 0 分
📌 一句话摘要 Meta、斯坦福和哈佛联合发布 ProgramBench 基准测试,要求 AI 从零复现完整软件,9 款顶级模型通过率全部为 0%,揭示当前 AI 在系统设计与软件工程能力上的根本性缺陷。 📝 详细摘要 文章报道了由 SWE-Bench 原班人马(Meta、斯坦福、哈佛)联合推出
📅 2026-05-09 00:01
(05-09 00:01)
大模型智能
人工智能
2 分鐘
★ 85
ProgramBench
AI 编程
基准测试
软件工程
●
0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench 作者新作把 AI 圈干沉默了
📌 一句话摘要 Meta FAIR 联合斯坦福、哈佛发布 ProgramBench 新基准,测试 AI 从零重建完整软件系统的能力,结果 Claude、GPT、Gemini 等顶级模型全部 0% 完成率,暴露了当前 AI 缺乏全局工程规划能力的核心瓶颈。 📝 详细摘要 文章报道了 Meta FA
📅 2026-05-07 10:05
(05-07 10:05)
机器之心
人工智能
1 分鐘
★ 86
ProgramBench
AI 编程
软件工程
基准测试