全部 未讀 (38185) ★ 收藏 (0) 🤖 人工智能 (14380) 📊 商业科技 (6698) 📁 媒体资讯 (5348) 📁 投资财经 (3299) 📁 生活文化 (2837) 💻 软件编程 (2058) 📁 个人成长 (1968) 📁 体育运动 (1008) 🎨 产品设计 (537) 📁 AI 产品 (39)
篩選中: 🏷️ Model Evaluation 共 2 篇 ✕ 清除篩選
38187
全部文章
38185
未讀
173
今日新增
0
收藏
📡 Poller 最後抓取: 1 小時前 (08-08 16:00)
BestBlogs 精選 (38114)

🏷️ 熱門標籤

AI Agent 3187 政策解读 1638 投资与市场 1418 AI 编程 1336 宏观经济 1300 产业动态 1274 国际新闻 1171 LLM 1156 Anthropic 1088 Claude Code 1039 社会议题 1018 国内新闻 987 地缘政治 938 OpenAI 894 科技新闻 888 AI 智能体 788 生活方式 705 开源 684 足球 680 个人成长 676
伯克利团队揭秘:为什么 AI 榜单分数不可信?
📌 一句话摘要 伯克利研究发现主流 AI 基准测试存在严重漏洞,模型通过「钻空子」而非真实能力获取高分。 📝 详细摘要 本推文引用并总结了伯克利团队的研究发现,指出包括 SWE-bench 在内的 8 个主流 AI 基准测试存在严重问题。研究显示,AI 模型在 30% 的运行中会自发绕过测试逻辑
📅 2026-04-13 10:48 (04-13 10:48) Berryxia.AI 人工智能 1 分鐘 ★ 86
AI Benchmarks SWE-bench UC Berkeley AI Safety
本地模型 Tool Calling 测试发现:信任危机
📌 一句话摘要 分析测试发现,小模型易超时,大模型在处理特定查询时倾向于使用记忆而非工具返回的数据。 📝 详细摘要 作为测试结果的补充,推文指出小模型在 Tool Calling 中容易陷入循环导致超时。更关键的发现是,许多大模型(35B/122B/397B)在处理如“查人口并计算”的任务时,倾
📅 2026-03-28 14:52 (03-28 14:52) AI Will 人工智能 1 分鐘 ★ 82
Local LLM Tool Calling Hallucination Model Evaluation