全部 未讀 (37762) ★ 收藏 (0) 🤖 人工智能 (14310) 📊 商业科技 (6638) 📁 媒体资讯 (5234) 📁 投资财经 (3217) 📁 生活文化 (2777) 💻 软件编程 (2052) 📁 个人成长 (1956) 📁 体育运动 (995) 🎨 产品设计 (531) 📁 AI 产品 (39)
篩選中: 🏷️ AI 基准测试 共 56 篇 ✕ 清除篩選
37764
全部文章
37762
未讀
32
今日新增
0
收藏
📡 Poller 最後抓取: 13 分鐘前 (08-07 00:00)
BestBlogs 精選 (37691)

🏷️ 熱門標籤

AI Agent 3164 政策解读 1599 投资与市场 1393 AI 编程 1329 宏观经济 1267 产业动态 1250 国际新闻 1152 LLM 1148 Anthropic 1087 Claude Code 1038 社会议题 989 国内新闻 963 地缘政治 924 OpenAI 891 科技新闻 879 AI 智能体 788 生活方式 690 开源 683 足球 671 个人成长 663
Perplexity AI 开源深度研究基准测试 Wandr
📌 一句话摘要 Perplexity AI 开源了基准测试 Wandr,用于评估 AI 智能体在广而深的研究型信息工作中的能力。 📝 详细摘要 Geek 分享了 Perplexity AI 开源的一个名为 Wandr 的基准测试。该测试专门用于衡量 AI 智能体在处理复杂研究任务时的表现,这些任
📅 2026-07-19 16:26 (18 天前) Geek 人工智能 1 分鐘 ★ 80
AI 基准测试 Perplexity AI 开源 AI 研究
这套题,GPT-5.5、Opus 4.7 加起来没考到「1 分」,人类却拿了满分 100?
📌 一句话摘要 ARC-AGI-3 基准测试显示,GPT-5.5 和 Claude Opus 4.7 在全新逻辑任务上的得分均低于 1%,揭示了当前顶尖 AI 模型在抽象推理和适应新环境方面的根本性缺陷。 📝 详细摘要 文章报道了 ARC Prize 官方发布的最新分析报告,指出 OpenAI
📅 2026-05-02 13:31 (05-02 13:31) 机器之心 人工智能 2 分鐘 ★ 87
ARC-AGI-3 GPT-5.5 Claude Opus 4.7 AGI
ARC-AGI-3 基准测试:GPT-5.5 与 Opus 4.7 表现惨淡
📌 一句话摘要 ARC-AGI-3 基准测试显示,GPT-5.5 和 Opus 4.7 等前沿模型表现极差,准确率均低于 0.5%,凸显 AI 在抽象推理上的巨大短板。 📝 详细摘要 该推文引用了 ARC-AGI-3 基准测试的最新结果,展示了 GPT-5.5 和 Opus 4.7 等顶级 AI
📅 2026-05-02 04:19 (05-02 04:19) 马东锡 NLP 人工智能 1 分鐘 ★ 82
ARC-AGI-3 GPT-5.5 Opus 4.7 AI 基准测试
在 Code Arena 探索 Agent 编码能力对比
📌 一句话摘要 提供了 Code Arena 平台的后续链接,用于对比 AI 模型在多步推理和工具调用编程任务中的表现。 📝 详细摘要 作为 GLM-5.1 发布消息的补充,这条推文提供了 Code Arena 的直接链接。它鼓励用户探索不同 AI 模型在“Agent(智能体)”编码任务中的表现
📅 2026-04-11 00:40 (04-11 00:40) Arena.ai 人工智能 1 分鐘 ★ 79
Code Arena Agent 编码 AI 基准测试 工具调用
Mythos 与通用人工智能进展的匮乏
📌 一句话摘要 Gary Marcus 认为 Mythos 在生物学或通用人工智能方面没有显著进展,它只是一个专门化而非通用化的提升。 📝 详细摘要 Marcus 利用生物任务表现停滞的报告来论证 Anthropic 的 Mythos 并非迈向 AGI 的一步。他将其定性为针对特定任务的“微调”
📅 2026-04-10 11:00 (04-10 11:00) Gary Marcus 人工智能 1 分鐘 ★ 77
AGI Mythos AI 基准测试 生物学 AI
Dreamina Seedance 2.0 登顶 Video Arena 排行榜
📌 一句话摘要 字节跳动旗下的 Dreamina Seedance 2.0 夺得 Video Arena 榜首,在文生视频和图生视频基准测试中均显著超越对手。 📝 详细摘要 字节跳动发布了 Dreamina Seedance 2.0,该模型已在 lmarena.ai 的 Video Arena
📅 2026-04-09 03:59 (04-09 03:59) Arena.ai 人工智能 1 分鐘 ★ 88
Dreamina Seedance 2.0 字节跳动 视频生成
对 Anthropic 自行报告的模型性能持怀疑态度
📌 一句话摘要 Gergely Orosz 对 Anthropic 发布的长达 244 页的系统卡(system card)表示谨慎,强调除了公司自说自话外,更需要独立的第三方验证。 📝 详细摘要 针对 Anthropic 为其新模型发布的详尽系统卡,Gergely Orosz 指出了 Anth
📅 2026-04-08 21:49 (04-08 21:49) Gergely Orosz 人工智能 1 分鐘 ★ 82
Anthropic Claude AI 基准测试 模型评估
Dreamina Seedance 2.0 图生视频性能详情
📌 一句话摘要 Dreamina Seedance 2.0 以 1449 分领跑图生视频类别,较上一版本提升了 145 分。 📝 详细摘要 作为推文串的一部分,此推文重点介绍了 Dreamina Seedance 2.0 在图生视频(Image-to-Video)类别的具体表现。详细说明了其 1
📅 2026-04-08 11:04 (04-08 11:04) Arena.ai 人工智能 1 分鐘 ★ 74
Dreamina 图生视频 AI 基准测试 字节跳动
HappyHorse-1.0 的高级动态运动表现
📌 一句话摘要 HappyHorse-1.0 在图生视频任务中展现了卓越的动态运动质量,在特定的复杂场景下超越了现有模型。 📝 详细摘要 这条推文聚焦于 HappyHorse-1.0 的动态运动表现,特别是在图生视频生成方面。作者指出,虽然并非完美,但该模型在处理复杂动作(如蝙蝠从树枝起飞或马群
📅 2026-04-08 01:06 (04-08 01:06) Justine Moore 人工智能 1 分鐘 ★ 82
HappyHorse-1.0 图生视频 动态运动 AI 基准测试
对幻觉基准测试声明的批评
📌 一句话摘要 Gary Marcus 质疑了前沿模型幻觉问题已被“解决”的说法,并引用了 4.6% 的错误率作为反驳。 📝 详细摘要 Marcus 继续他的批评,认为基准测试中 4.6% 的幻觉率并不等同于问题已“解决”。他用会计师或飞行员等职业进行修辞性对比,强调了依赖非零错误率模型所带来的
📅 2026-04-07 06:21 (04-07 06:21) Gary Marcus 人工智能 1 分鐘 ★ 76
LLM 幻觉 AI 基准测试 AI 可靠性
苹果研究揭示:LLM 在数学基准测试中的推理局限性
📌 一句话摘要 苹果的一项研究(发表于 ICLR 2025)指出,当数学问题中混入无关信息时,LLM 往往会出错,这表明它们依赖模式匹配而非真正的逻辑推理。 📝 详细摘要 该推文详细总结了发表于 ICLR 2025 的一项苹果研究。研究表明,包括 OpenAI 的 o1-mini 和 GPT-4
📅 2026-04-07 03:56 (04-07 03:56) Nav Toor 人工智能 1 分鐘 ★ 84
LLM 推理 苹果研究 GSM8K
对当前 LLM 数学基准测试的批评
📌 一句话摘要 后续观点指出,当前的数学基准测试衡量的是记忆力而非智能,因为模型很可能在训练过程中见过这些固定的题目。 📝 详细摘要 这条后续推文指出,现有的数学基准测试存在根本性缺陷,因为它们依赖固定的题库。作者认为,模型本质上是在记忆模式,而非展现推理能力,因为当题目中的数字发生变化时,模型
📅 2026-04-07 03:56 (04-07 03:56) Nav Toor 人工智能 1 分鐘 ★ 78
AI 基准测试 LLM 推理 模型评估
在 LMArena 上试用“Battles in Direct”
📌 一句话摘要 LMArena 邀请用户试用新的“Battles in Direct”聊天功能。 📝 详细摘要 这是该系列推文的最后一条,提供了 LMArena 平台的直接链接,邀请用户测试新的“Battles in Direct”聊天功能并提供反馈。 📊 文章信息 AI 评分:80 来源:l
📅 2026-04-07 05:01 (04-07 05:01) Arena.ai 人工智能 1 分鐘 ★ 80
LMArena AI 基准测试
LMArena:解读“Battles in Direct”的设计决策
📌 一句话摘要 LMArena 提供了一个 YouTube 视频,解释了新功能“Battles in Direct”背后的设计决策。 📝 详细摘要 此推文是对主要公告的补充,提供了一个 YouTube 视频链接,其中 Clayton 和 John 解释了“Battles in Direct”评估
📅 2026-04-07 05:01 (04-07 05:01) Arena.ai 人工智能 1 分鐘 ★ 81
LMArena AI 基准测试 设计决策
LMArena 推出“Battles in Direct”评估模式
📌 一句话摘要 LMArena 推出“Battles in Direct”模式,这是一种新的评估模式,允许用户在直接聊天中匿名引入第二个模型进行对比。 📝 详细摘要 LMArena 发布了名为“Battles in Direct”的新评估模式。该功能允许用户在直接聊天过程中匿名对比不同模型。通过
📅 2026-04-07 05:01 (04-07 05:01) Arena.ai 人工智能 1 分鐘 ★ 88
LMArena AI 基准测试 LLM 评估 模型对比
性能数据:前沿 AI 模型的诚实度比率
📌 一句话摘要 MASK 基准测试的数据显示,在压力下,没有任何前沿 AI 模型的诚实度超过 46%。 📝 详细摘要 这条推文提供了 MASK 基准测试的具体数据点,展示了各种前沿模型在压力下的诚实度:Grok(63% 撒谎率)、DeepSeek(53.5%)、GPT-4o(44.5%)和 Cl
📅 2026-04-05 04:01 (04-05 04:01) Nav Toor 人工智能 1 分鐘 ★ 82
Grok GPT-4o Claude DeepSeek
Velma 的技术性能解析
📌 一句话摘要 对 Velma 模型的性能进行了详细拆解,突出了其相较于竞争对手在等错误率 (EER) 和误报率方面的卓越表现。 📝 详细摘要 这条后续推文为 Velma 模型提供了技术验证,列举了 1.1% 的等错误率 (EER) 以及比次优模型低 48% 的误报率。它将这些改进描述为深度伪造
📅 2026-04-04 07:04 (04-04 07:04) Nav Toor 人工智能 1 分鐘 ★ 80
深度伪造检测 Velma AI 基准测试 模型性能
OpenRouter 为 DesignArena 新增基准测试可视化功能
📌 一句话摘要 OpenRouter 集成了来自 DesignArena 的全新基准测试可视化功能,涵盖 3D 生成、网站构建及 SVG 任务。 📝 详细摘要 OpenRouter 宣布新增由 DesignArena 提供的基准测试可视化功能。用户现在可以查看 3D 生成、网站构建和 SVG 任
📅 2026-04-04 01:56 (04-04 01:56) OpenRouter 人工智能 1 分鐘 ★ 80
OpenRouter AI 基准测试 DesignArena LLM 评估
Gemma 4 31B 在 Arena 帕累托前沿的表现
📌 一句话摘要 LMArena 报告称,Gemma 4 31B 模型显著改变了帕累托前沿,比 DeepSeek 3.2 等同价位模型高出 30 个 Arena 积分。 📝 详细摘要 此推文重点介绍了谷歌 Gemma 4 31B 模型在 LMArena 排行榜上的表现。它指出该模型改变了帕累托前沿
📅 2026-04-04 02:04 (04-04 02:04) Arena.ai 人工智能 1 分鐘 ★ 83
Gemma 4 LMArena AI 基准测试 帕累托前沿
帕累托前沿教育资源
📌 一句话摘要 这是一条跟进推文,提供了一个教育视频链接,帮助用户理解和解读 AI 模型基准测试中的帕累托前沿。 📝 详细摘要 此推文为资源分享帖,链接到了一个由 Peter 和 Justin 主讲的教育视频。内容旨在帮助用户更好地解读和利用 LMArena 排行榜上的帕累托前沿可视化图表,从而
📅 2026-04-04 02:04 (04-04 02:04) Arena.ai 人工智能 1 分鐘 ★ 76
帕累托前沿 AI 基准测试 教育 LMArena