面壁智能联合清华大学、OpenBMB 开源了 UltraData 系列两大 L3 层级数据集:全球最大中文预训练合成数据 Ultra-FineWeb-L3 和千万级 SFT 数据 UltraData-SFT-2605,并公开了 L0-L4 数据分级治理体系,旨在推动大模型竞争从参数规模转向数据质量。
📝 详细摘要
本文由面壁智能团队发布,核心介绍了其联合清华大学、OpenBMB 开源的 UltraData 系列数据集。文章首先指出,大模型竞争的下半场焦点已从参数规模转向数据质量。为此,面壁智能提出了 L0-L4 数据分级治理体系,将数据按加工深度分为五级,强调在不同训练阶段使用不同层级的数据,以实现成本与收益的最优平衡。基于此体系,他们开源了两大 L3 数据集:Ultra-FineWeb-L3,这是当前全球最大规模的中文预训练合成数据,总量超 600B Tokens(中文超 200B),通过大规模 Q&A 生成与多风格改写,将原始网页文本转化为结构化对话,提升模型推理能力;UltraData-SFT-2605,是国内首次开源的千万级、包含「深思考/非思考」全覆盖的 SFT 数据,覆盖数学、代码、知识等领域,并公开了全流程质量治理。文章还以最新发布的 MiniCPM5-1B 模型为例,展示了该数据治理体系的实际效果,该模型以 17.9 分登顶 Artificial Analysis 排行榜,全面超越同尺寸竞品。最后,文章强调了此次开源对端侧智能产业的价值,并呼吁行业转向对数据理解和加工能力的深层比拼。
💡 主要观点
- 大模型竞争下半场,数据质量成为关键差异点。 当公开语料库逐渐耗尽,模型架构趋于收敛,如何从存量数据中榨取更高密度的知识,成为决定模型能力边界的关键,而非单纯堆砌参数和算力。
💬 文章金句
- 大模型竞争的下半场,焦点正从参数规模转向数据质量。
- 这套体系的核心逻辑是「好钢用在刀刃上」,看到了不同训练阶段对数据截然不同的需求。
- Ultra‑FineWeb‑L3 完成了从 「可读文本」到 「好学数据」 的关键转化。
- 这种全流程透明化,为社区提供了一个可审计、可复现的数据工程范式。
- 当数据不再是不可名状的黑箱,端侧模型的无限可能才刚刚开始释放。
📊 文章信息
AI 初评:88
来源:Datawhale
作者:Datawhale
分类:人工智能
语言:中文
阅读时间:14 分钟
字数:3448
标签: 数据治理, 合成数据, SFT, 开源数据集, 面壁智能