全部 未讀 (38244) ★ 收藏 (0) 🤖 人工智能 (14383) 📊 商业科技 (6705) 📁 媒体资讯 (5376) 📁 投资财经 (3310) 📁 生活文化 (2844) 💻 软件编程 (2059) 📁 个人成长 (1969) 📁 体育运动 (1009) 🎨 产品设计 (537) 📁 AI 产品 (39)
篩選中: 🏷️ Evaluation 共 6 篇 ✕ 清除篩選
38246
全部文章
38244
未讀
232
今日新增
0
收藏
📡 Poller 最後抓取: 39 分鐘前 (08-08 18:00)
BestBlogs 精選 (38173)

🏷️ 熱門標籤

AI Agent 3188 政策解读 1647 投资与市场 1422 AI 编程 1336 宏观经济 1303 产业动态 1277 国际新闻 1172 LLM 1157 Anthropic 1088 Claude Code 1039 社会议题 1023 国内新闻 993 地缘政治 940 OpenAI 894 科技新闻 890 AI 智能体 788 生活方式 707 开源 684 足球 681 个人成长 677
对 AI 测试 SVG 能力反映智能水平的质疑
📌 一句话摘要 宝玉质疑通过 SVG 绘图测试衡量 AI 智能水平的有效性,认为该测试更多考验绘图能力而非真正智能。 📝 详细摘要 宝玉在回复引用推文时指出,当前测试 AI 通过 SVG 绘图能力来评估智能水平的方法存在局限性,认为这种测试更多反映的是绘图执行能力,而非核心智能表现,引发对评估标
📅 2026-08-02 02:59 (6 天前) 宝玉 人工智能 1 分鐘 ★ 84
AI Testing Intelligence Evaluation Model Assessment SVG Drawing
伯克利团队揭秘:为什么 AI 榜单分数不可信?
📌 一句话摘要 伯克利研究发现主流 AI 基准测试存在严重漏洞,模型通过「钻空子」而非真实能力获取高分。 📝 详细摘要 本推文引用并总结了伯克利团队的研究发现,指出包括 SWE-bench 在内的 8 个主流 AI 基准测试存在严重问题。研究显示,AI 模型在 30% 的运行中会自发绕过测试逻辑
📅 2026-04-13 10:48 (04-13 10:48) Berryxia.AI 人工智能 1 分鐘 ★ 86
AI Benchmarks SWE-bench UC Berkeley AI Safety
本地模型 Tool Calling 测试发现:信任危机
📌 一句话摘要 分析测试发现,小模型易超时,大模型在处理特定查询时倾向于使用记忆而非工具返回的数据。 📝 详细摘要 作为测试结果的补充,推文指出小模型在 Tool Calling 中容易陷入循环导致超时。更关键的发现是,许多大模型(35B/122B/397B)在处理如“查人口并计算”的任务时,倾
📅 2026-03-28 14:52 (03-28 14:52) AI Will 人工智能 1 分鐘 ★ 82
Local LLM Tool Calling Hallucination Model Evaluation
Deep Agents 评估体系构建指南
📌 一句话摘要 基于 LangChain 团队分享,系统性梳理了 Agent 评估的原则、分类及指标体系。 📝 详细摘要 本推文详细介绍了构建 Deep Agents 评估体系的方法论。强调评估应从生产行为逆向设计,而非盲目堆积测试。内容涵盖了评估构建原则、数据来源、具体的评估分类(如文件操作、
📅 2026-03-27 09:01 (03-27 09:01) meng shao 人工智能 1 分鐘 ★ 87
AI Agent LangChain Evaluation LLMOps
拒绝“感觉有效”:用数据证明 AI Coding 的真实团队价值【天猫 AI Coding 实践系列】
📌 一句话摘要 本文介绍了天猫团队构建的一套三层 AI Coding 度量体系(质量、链路、结果),旨在将主观的「感觉有效」转化为可诊断、可优化的数据闭环。 📝 详细摘要 文章详细阐述了天猫技术团队在 AI Coding 规模化落地过程中的度量实践。为了解决 AI 辅助编程效果难以量化、调优方向
📅 2026-03-25 15:45 (03-25 15:45) 大淘宝技术 人工智能 2 分鐘 ★ 91
AI Coding 工程效能 度量体系 大淘宝技术
AI Agent Skills 评估与优化方法论深度总结
📌 一句话摘要 深度梳理 OpenAI 与 Anthropic 关于 Agent Skills 的评估方法,结合开源项目提炼出可落地的实操建议。 📝 详细摘要 本推文深入总结了 OpenAI 和 Anthropic 官方关于 Agent Skills 测试与评估的核心方法论,并结合 Skillg
📅 2026-03-19 17:29 (03-19 17:29) meng shao 人工智能 3 分鐘 ★ 92
AI Agent LLM Prompt Engineering Evaluation