← 回總覽

模型好不好用,谁说了算?从榜单崇拜到自建评测

📅 2026-07-29 14:54 阿里云开发者 人工智能 1 分鐘 1250 字 評分: 88
大模型评测 古德哈特定律 自建测试集 AI 工程实践 模型评估
📌 一句话摘要 本文剖析了大模型评测榜单的局限性,指出公开榜单只能提供行业坐标而无法保证业务场景的适用性,并提出了自建测试集以规避古德哈特定律的务实方案。 📝 详细摘要 文章回顾了从固定考卷(如 MMLU、HLE)到真人盲测(Chatbot Arena)、再到真实任务(SWE-bench)和 Agent 全链路评测(BrowseComp)的演进过程,指出所有公开评测最终都会因模型针对指标优化而失效(古德哈特定律)。作者认为最务实的做法是用自己遇到的真实难题构建测试集来评测模型,这套数据不仅可以作为测试集,还可以转换为 few-shot 样本在日常工作中增强模型能力。文章最后展示了利用 AI

📌 一句话摘要

本文剖析了大模型评测榜单的局限性,指出公开榜单只能提供行业坐标而无法保证业务场景的适用性,并提出了自建测试集以规避古德哈特定律的务实方案。

📝 详细摘要

文章回顾了从固定考卷(如 MMLU、HLE)到真人盲测(Chatbot Arena)、再到真实任务(SWE-bench)和 Agent 全链路评测(BrowseComp)的演进过程,指出所有公开评测最终都会因模型针对指标优化而失效(古德哈特定律)。作者认为最务实的做法是用自己遇到的真实难题构建测试集来评测模型,这套数据不仅可以作为测试集,还可以转换为 few-shot 样本在日常工作中增强模型能力。文章最后展示了利用 AI 工具快速构建测试集的方法,并附带了阿里云千问 AI 平台的推广信息。

💡 主要观点

- 公开榜单只能提供行业坐标,无法保证模型在特定业务场景下的表现。 作者指出,无论是选择题、真人投票还是真实任务评测,模型都会针对这些指标进行优化,导致榜单分数失真,无法反映模型在具体应用中的实际能力。

大模型评测经历了四代演进,但都难以避免古德哈特定律的困扰。 从固定考卷被刷满,到真人盲测被偏好诱导,再到真实任务与 Agent 评测成本高昂且环境敏感,每一代评测方法最终都会失去区分度。
自建测试集是规避评测失真的最务实方案,且可一鱼两用。 作者建议收集自身遇到的难题构建测试集,既可用于评测模型,也可转换为 few-shot 样本用于日常增强模型能力,实现评测与应用的闭环。
利用 AI 工具可高效构建结构化测试数据集。 作者分享了使用 Chrome 插件将自然语言语句自动转换为 jsonl 格式测试集的方法,大幅降低了自建评测集的门槛。

💬 文章金句

- 当一项指标成为目标时,它就不再是一项好的指标了。

  • 公开榜单能给你一个行业坐标。自己的测试集,才能告诉你这个模型能不能进流程。
  • 一鱼两吃:出新模型时拿它当测试集,日常工作中拿它当 few-shot 增强模型能力。

📊 文章信息

AI 初评:88

来源:阿里云开发者

作者:阿里云开发者

分类:人工智能

语言:中文

阅读时间:14 分钟

字数:3449

标签: 大模型评测, 古德哈特定律, 自建测试集, AI 工程实践, 模型评估

阅读完整文章

查看原文 → 發佈: 2026-07-29 14:54:00 收錄: 2026-07-29 16:00:36

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。