← 回總覽

大模型竞争下半场:千万级 SFT + 全球最大中文合成数据,一起开源了!

📅 2026-05-29 22:26 Datawhale 人工智能 2 分鐘 1912 字 評分: 88
数据治理 合成数据 SFT 开源数据集 面壁智能
📌 一句话摘要 面壁智能联合清华大学、OpenBMB 开源了 UltraData 系列两大 L3 层级数据集:全球最大中文预训练合成数据 Ultra-FineWeb-L3 和千万级 SFT 数据 UltraData-SFT-2605,并公开了 L0-L4 数据分级治理体系,旨在推动大模型竞争从参数规模转向数据质量。 📝 详细摘要 本文由面壁智能团队发布,核心介绍了其联合清华大学、OpenBMB 开源的 UltraData 系列数据集。文章首先指出,大模型竞争的下半场焦点已从参数规模转向数据质量。为此,面壁智能提出了 L0-L4 数据分级治理体系,将数据按加工深度分为五级,强调在不同训练阶段

📌 一句话摘要

面壁智能联合清华大学、OpenBMB 开源了 UltraData 系列两大 L3 层级数据集:全球最大中文预训练合成数据 Ultra-FineWeb-L3 和千万级 SFT 数据 UltraData-SFT-2605,并公开了 L0-L4 数据分级治理体系,旨在推动大模型竞争从参数规模转向数据质量。

📝 详细摘要

本文由面壁智能团队发布,核心介绍了其联合清华大学、OpenBMB 开源的 UltraData 系列数据集。文章首先指出,大模型竞争的下半场焦点已从参数规模转向数据质量。为此,面壁智能提出了 L0-L4 数据分级治理体系,将数据按加工深度分为五级,强调在不同训练阶段使用不同层级的数据,以实现成本与收益的最优平衡。基于此体系,他们开源了两大 L3 数据集:Ultra-FineWeb-L3,这是当前全球最大规模的中文预训练合成数据,总量超 600B Tokens(中文超 200B),通过大规模 Q&A 生成与多风格改写,将原始网页文本转化为结构化对话,提升模型推理能力;UltraData-SFT-2605,是国内首次开源的千万级、包含「深思考/非思考」全覆盖的 SFT 数据,覆盖数学、代码、知识等领域,并公开了全流程质量治理。文章还以最新发布的 MiniCPM5-1B 模型为例,展示了该数据治理体系的实际效果,该模型以 17.9 分登顶 Artificial Analysis 排行榜,全面超越同尺寸竞品。最后,文章强调了此次开源对端侧智能产业的价值,并呼吁行业转向对数据理解和加工能力的深层比拼。

💡 主要观点

- 大模型竞争下半场,数据质量成为关键差异点。 当公开语料库逐渐耗尽,模型架构趋于收敛,如何从存量数据中榨取更高密度的知识,成为决定模型能力边界的关键,而非单纯堆砌参数和算力。

面壁智能提出 L0-L4 数据分级治理体系,实现精细化数据管理。 该体系将数据从原始网页到最终编排数据分为五级,主张在不同训练阶段(如预训练前期、退火、SFT)使用不同层级的数据,实现「好钢用在刀刃上」,在成本与收益间找到最优平衡。
Ultra-FineWeb-L3 是全球最大中文预训练合成数据,将「可读文本」转化为「好学数据」。 该数据集基于 L2 精筛网页,通过大规模 Q&A 生成与多风格改写,将平铺直叙的文本重构为「提问-思考-回答」的结构化对话,总量超 600B Tokens,中文超 200B,旨在教会模型推理。
UltraData-SFT-2605 是千万级通用 SFT 数据,包含「深思考」与「非思考」样本。 该数据集覆盖数学、代码、知识等领域,包含带有完整思维链的深思考数据,对模型发展逐步推理和自我纠错能力至关重要,且全流程质量治理透明化,杜绝数据污染。
MiniCPM5-1B 模型验证了数据治理体系的有效性,登顶性能榜单。 该模型在训练中精确配置了不同层级的数据,以 17.9 分登顶 Artificial Analysis 排行榜,INT4 权重仅约 0.5GB,可在端侧设备流畅运行,证明了高质量数据能让小参数模型获得强大能力。

💬 文章金句

- 大模型竞争的下半场,焦点正从参数规模转向数据质量。

  • 这套体系的核心逻辑是「好钢用在刀刃上」,看到了不同训练阶段对数据截然不同的需求。
  • Ultra‑FineWeb‑L3 完成了从 「可读文本」到 「好学数据」 的关键转化。
  • 这种全流程透明化,为社区提供了一个可审计、可复现的数据工程范式。
  • 当数据不再是不可名状的黑箱,端侧模型的无限可能才刚刚开始释放。

📊 文章信息

AI 初评:88

来源:Datawhale

作者:Datawhale

分类:人工智能

语言:中文

阅读时间:14 分钟

字数:3448

标签: 数据治理, 合成数据, SFT, 开源数据集, 面壁智能

阅读完整文章

查看原文 → 發佈: 2026-05-29 22:26:00 收錄: 2026-05-30 02:00:00

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。