← 回總覽

ICML 2026 | ML-Embed 用一个框架打破嵌入模型的三重壁垒

📅 2026-06-15 11:48 PaperAgent 人工智能 2 分鐘 1657 字 評分: 82
LLM 文本嵌入 多语言模型 模型压缩 ICML 2026
📌 一句话摘要 蚂蚁集团与上海交通大学提出 ML-Embed 模型,通过 3D-ML 框架在嵌入层、层数、向量维度三个维度实现嵌套压缩,以更少数据在 9 项 MTEB 榜单刷新 SOTA,显著提升低资源语言性能,并实现全量开源。 📝 详细摘要 本文介绍了一项被 ICML 2026 收录的研究工作——ML-Embed 多语言嵌入模型。研究团队(蚂蚁集团与上海交通大学)指出当前嵌入模型存在三大壁垒:计算门槛高、语言覆盖失衡、研究黑箱化。他们提出 3D-ML(三维嵌套学习)框架,将俄罗斯套娃式的嵌套训练原则扩展到三个维度:MEL(嵌入层低秩分解与动态秩采样)、MLL(多层同时训练实现深度可调)、

📌 一句话摘要

蚂蚁集团与上海交通大学提出 ML-Embed 模型,通过 3D-ML 框架在嵌入层、层数、向量维度三个维度实现嵌套压缩,以更少数据在 9 项 MTEB 榜单刷新 SOTA,显著提升低资源语言性能,并实现全量开源。

📝 详细摘要

本文介绍了一项被 ICML 2026 收录的研究工作——ML-Embed 多语言嵌入模型。研究团队(蚂蚁集团与上海交通大学)指出当前嵌入模型存在三大壁垒:计算门槛高、语言覆盖失衡、研究黑箱化。他们提出 3D-ML(三维嵌套学习)框架,将俄罗斯套娃式的嵌套训练原则扩展到三个维度:MEL(嵌入层低秩分解与动态秩采样)、MLL(多层同时训练实现深度可调)、MRL(向量维度按需截断)。三者通过统一损失函数联合优化。在数据方面,团队从 121 个公开数据源汇聚 5000 万训练样本,覆盖 282 种自然语言和 40 余种编程语言,总训练数据量仅为同类 SOTA 模型的约 1/5。在 17 个 MTEB 基准、430 个任务上的评测中,ML-Embed-8B 在 9 项刷新 SOTA,低资源语言提升显著(波兰语 +22.89、越南语 +6.88 等)。消融实验验证了各组件协同效应与 MEL 的鲁棒性,并在 EuroBERT 上验证了框架的泛化性。模型、代码、数据集已全量开源。

💡 主要观点

- 3D-ML 框架在嵌入层、层数、向量维度三个维度实现嵌套压缩。 MEL 通过 SVD 低秩分解压缩嵌入层参数,MLL 让模型在推理时按需选择深度,MRL 支持向量维度截断,三者联合优化使模型在训练、推理、存储全生命周期可弹性缩放。

ML-Embed 以约 1/5 的数据量达到 9 项 MTEB SOTA。 总训练数据仅 3500 万(2700 万预热 + 830 万微调),远少于 Qwen3-Embedding(1.62 亿)等模型,但覆盖 282 种语言,低资源语言提升显著,验证了数据多样性与质量的重要性。
MEL 的套娃训练使低秩分解具有强鲁棒性。 直接对基线模型做 SVD 分解会导致性能崩溃(69.68→53.25),而 MEL 训练的模型即使将秩降至 64 仍保持 64.30 高分,因为训练强迫关键信息集中在低秩空间前几个维度。
语言多样性提升不牺牲主流语言性能。 在相同底座下对比,ML-Embed 数据在 17 个基准中 9 项优于 KaLM-Embedding 数据,尤其在代码基准领先显著,中文性能略低但符合数据分布预期。
3D-ML 框架具有良好泛化性。 在 EuroBERT-210M 上验证,3D-ML 训练后剪枝到 120M 仅损失 3.61 分,而直接结构剪枝损失 16.28 分,证明框架不依赖特定模型架构。

💬 文章金句

- 最核心的信息永远在最内层。

  • ML-Embed 的数据分布则真正反映了世界语言的多样性。
  • 语言多样性的提升,并不以牺牲主流语言性能为代价。

📊 文章信息

AI 初评:82

来源:PaperAgent

作者:PaperAgent

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2998

标签: LLM, 文本嵌入, 多语言模型, 模型压缩, ICML 2026

阅读完整文章

查看原文 → 發佈: 2026-06-15 11:48:00 收錄: 2026-06-15 20:00:31

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。