蚂蚁集团与上海交通大学提出 ML-Embed 模型,通过 3D-ML 框架在嵌入层、层数、向量维度三个维度实现嵌套压缩,以更少数据在 9 项 MTEB 榜单刷新 SOTA,显著提升低资源语言性能,并实现全量开源。
📝 详细摘要
本文介绍了一项被 ICML 2026 收录的研究工作——ML-Embed 多语言嵌入模型。研究团队(蚂蚁集团与上海交通大学)指出当前嵌入模型存在三大壁垒:计算门槛高、语言覆盖失衡、研究黑箱化。他们提出 3D-ML(三维嵌套学习)框架,将俄罗斯套娃式的嵌套训练原则扩展到三个维度:MEL(嵌入层低秩分解与动态秩采样)、MLL(多层同时训练实现深度可调)、MRL(向量维度按需截断)。三者通过统一损失函数联合优化。在数据方面,团队从 121 个公开数据源汇聚 5000 万训练样本,覆盖 282 种自然语言和 40 余种编程语言,总训练数据量仅为同类 SOTA 模型的约 1/5。在 17 个 MTEB 基准、430 个任务上的评测中,ML-Embed-8B 在 9 项刷新 SOTA,低资源语言提升显著(波兰语 +22.89、越南语 +6.88 等)。消融实验验证了各组件协同效应与 MEL 的鲁棒性,并在 EuroBERT 上验证了框架的泛化性。模型、代码、数据集已全量开源。
💡 主要观点
- 3D-ML 框架在嵌入层、层数、向量维度三个维度实现嵌套压缩。 MEL 通过 SVD 低秩分解压缩嵌入层参数,MLL 让模型在推理时按需选择深度,MRL 支持向量维度截断,三者联合优化使模型在训练、推理、存储全生命周期可弹性缩放。
💬 文章金句
- 最核心的信息永远在最内层。
- ML-Embed 的数据分布则真正反映了世界语言的多样性。
- 语言多样性的提升,并不以牺牲主流语言性能为代价。
📊 文章信息
AI 初评:82
来源:PaperAgent
作者:PaperAgent
分类:人工智能
语言:中文
阅读时间:12 分钟
字数:2998
标签: LLM, 文本嵌入, 多语言模型, 模型压缩, ICML 2026