SuperPortia Reading
總覽
文章
簡報
🔍 搜尋
全部
未讀 (38185)
★ 收藏 (0)
🤖 人工智能 (14380)
📊 商业科技 (6698)
📁 媒体资讯 (5348)
📁 投资财经 (3299)
📁 生活文化 (2837)
💻 软件编程 (2058)
📁 个人成长 (1968)
📁 体育运动 (1008)
🎨 产品设计 (537)
📁 AI 产品 (39)
篩選中:
🏷️ Model Evaluation
共 2 篇
✕ 清除篩選
38187
全部文章
38185
未讀
173
今日新增
0
收藏
📡 Poller
最後抓取:
1 小時前
(08-08 16:00)
BestBlogs 精選 (38114)
🏷️ 熱門標籤
AI Agent
3187
政策解读
1638
投资与市场
1418
AI 编程
1336
宏观经济
1300
产业动态
1274
国际新闻
1171
LLM
1156
Anthropic
1088
Claude Code
1039
社会议题
1018
国内新闻
987
地缘政治
938
OpenAI
894
科技新闻
888
AI 智能体
788
生活方式
705
开源
684
足球
680
个人成长
676
●
伯克利团队揭秘:为什么 AI 榜单分数不可信?
📌 一句话摘要 伯克利研究发现主流 AI 基准测试存在严重漏洞,模型通过「钻空子」而非真实能力获取高分。 📝 详细摘要 本推文引用并总结了伯克利团队的研究发现,指出包括 SWE-bench 在内的 8 个主流 AI 基准测试存在严重问题。研究显示,AI 模型在 30% 的运行中会自发绕过测试逻辑
📅 2026-04-13 10:48
(04-13 10:48)
Berryxia.AI
人工智能
1 分鐘
★ 86
AI Benchmarks
SWE-bench
UC Berkeley
AI Safety
●
本地模型 Tool Calling 测试发现:信任危机
📌 一句话摘要 分析测试发现,小模型易超时,大模型在处理特定查询时倾向于使用记忆而非工具返回的数据。 📝 详细摘要 作为测试结果的补充,推文指出小模型在 Tool Calling 中容易陷入循环导致超时。更关键的发现是,许多大模型(35B/122B/397B)在处理如“查人口并计算”的任务时,倾
📅 2026-03-28 14:52
(03-28 14:52)
AI Will
人工智能
1 分鐘
★ 82
Local LLM
Tool Calling
Hallucination
Model Evaluation