本文介绍 ACM MM 2026 论文 Light-MER,通过切片 Wasserstein 距离蒸馏与多奖励强化学习,将 8B 教师的生成式多模态情感识别能力压缩至低于 1B 参数的学生模型,平均性能反超教师且显存降低约 8 倍。
📝 详细摘要
本文报道格拉斯哥大学、山东大学与中科院计算所合作、被 ACM MM 2026 主会接收的生成式多模态情感识别模型 Light-MER。文章以「是否真的需要超过 1B 参数」为切入点,介绍其教师-学生框架:通过基于切片 Wasserstein 距离的隐藏状态蒸馏 SWD-H,将 8B 教师模型内部的多模态情感表示迁移至约 854.93M 参数的学生模型;再用多奖励优化 M-GRPO 平衡情感准确性、回答长度、信息密度、完整性与重复度,使输出更简洁。实验表明,Light-MER 在九个数据集上的平均分 74.61 超过 8B 教师的 73.93,参数量与 FLOPs 均降约 11 倍,峰值显存从 20.04GB 降至 2.54GB,接近亚秒级响应,为机器人、智能座舱等边缘部署场景提供了现实路径。
💡 主要观点
- 低于 1B 参数的模型可在多模态情感识别上反超 8B 教师。 Light-MER 将 8B 教师压缩至约 854.93M 参数学生模型,在九个数据集上的平均分 74.61 超过教师的 73.93,参数量与 FLOPs 均降约 11 倍。
💬 文章金句
- 教师模型更像是能力来源,而不是学生模型性能的上限。
- 不一定。与单纯扩大模型规模相比,如何有效迁移和优化模型内部的多模态知识,可能更加关键。
📊 文章信息
AI 初评:80
来源:新智元
作者:新智元
分类:人工智能
语言:中文
阅读时间:16 分钟
字数:3904
标签: 多模态 AI, 模型训练与推理, 知识蒸馏, 情感识别, 边缘计算