本文剖析了大模型评测榜单的局限性,指出公开榜单只能提供行业坐标而无法保证业务场景的适用性,并提出了自建测试集以规避古德哈特定律的务实方案。
📝 详细摘要
文章回顾了从固定考卷(如 MMLU、HLE)到真人盲测(Chatbot Arena)、再到真实任务(SWE-bench)和 Agent 全链路评测(BrowseComp)的演进过程,指出所有公开评测最终都会因模型针对指标优化而失效(古德哈特定律)。作者认为最务实的做法是用自己遇到的真实难题构建测试集来评测模型,这套数据不仅可以作为测试集,还可以转换为 few-shot 样本在日常工作中增强模型能力。文章最后展示了利用 AI 工具快速构建测试集的方法,并附带了阿里云千问 AI 平台的推广信息。
💡 主要观点
- 公开榜单只能提供行业坐标,无法保证模型在特定业务场景下的表现。 作者指出,无论是选择题、真人投票还是真实任务评测,模型都会针对这些指标进行优化,导致榜单分数失真,无法反映模型在具体应用中的实际能力。
💬 文章金句
- 当一项指标成为目标时,它就不再是一项好的指标了。
- 公开榜单能给你一个行业坐标。自己的测试集,才能告诉你这个模型能不能进流程。
- 一鱼两吃:出新模型时拿它当测试集,日常工作中拿它当 few-shot 增强模型能力。
📊 文章信息
AI 初评:88
来源:阿里云开发者
作者:阿里云开发者
分类:人工智能
语言:中文
阅读时间:14 分钟
字数:3449
标签: 大模型评测, 古德哈特定律, 自建测试集, AI 工程实践, 模型评估