← 回總覽

超过 1B 参数都是浪费?多模态情感模型进入「小」时代 | ACM MM'26

📅 2026-08-01 13:32 新智元 人工智能 2 分鐘 1390 字 評分: 80
多模态 AI 模型训练与推理 知识蒸馏 情感识别 边缘计算
📌 一句话摘要 本文介绍 ACM MM 2026 论文 Light-MER,通过切片 Wasserstein 距离蒸馏与多奖励强化学习,将 8B 教师的生成式多模态情感识别能力压缩至低于 1B 参数的学生模型,平均性能反超教师且显存降低约 8 倍。 📝 详细摘要 本文报道格拉斯哥大学、山东大学与中科院计算所合作、被 ACM MM 2026 主会接收的生成式多模态情感识别模型 Light-MER。文章以「是否真的需要超过 1B 参数」为切入点,介绍其教师-学生框架:通过基于切片 Wasserstein 距离的隐藏状态蒸馏 SWD-H,将 8B 教师模型内部的多模态情感表示迁移至约 854.9

📌 一句话摘要

本文介绍 ACM MM 2026 论文 Light-MER,通过切片 Wasserstein 距离蒸馏与多奖励强化学习,将 8B 教师的生成式多模态情感识别能力压缩至低于 1B 参数的学生模型,平均性能反超教师且显存降低约 8 倍。

📝 详细摘要

本文报道格拉斯哥大学、山东大学与中科院计算所合作、被 ACM MM 2026 主会接收的生成式多模态情感识别模型 Light-MER。文章以「是否真的需要超过 1B 参数」为切入点,介绍其教师-学生框架:通过基于切片 Wasserstein 距离的隐藏状态蒸馏 SWD-H,将 8B 教师模型内部的多模态情感表示迁移至约 854.93M 参数的学生模型;再用多奖励优化 M-GRPO 平衡情感准确性、回答长度、信息密度、完整性与重复度,使输出更简洁。实验表明,Light-MER 在九个数据集上的平均分 74.61 超过 8B 教师的 73.93,参数量与 FLOPs 均降约 11 倍,峰值显存从 20.04GB 降至 2.54GB,接近亚秒级响应,为机器人、智能座舱等边缘部署场景提供了现实路径。

💡 主要观点

- 低于 1B 参数的模型可在多模态情感识别上反超 8B 教师。 Light-MER 将 8B 教师压缩至约 854.93M 参数学生模型,在九个数据集上的平均分 74.61 超过教师的 73.93,参数量与 FLOPs 均降约 11 倍。

隐藏状态蒸馏比输出概率蒸馏更适合情感识别。 教师输出分布过度集中,榜首 token 占约 98% 概率,学生难以从中学会情感线索的组织方式;SWD-H 用切片 Wasserstein 距离对齐隐藏状态分布,保留更丰富的多模态信息。
多奖励优化能同时改善生成质量与推理效率。 M-GRPO 综合情感准确性、回答长度、信息密度、完整性与重复度五项奖励,使学生输出更简洁流畅,生成长度收敛至约 53 个英文单词。
小模型的实际意义在于边缘部署。 峰值显存从 20.04GB 降至 2.54GB,直接输出情感标签约 0.52 秒/样本,使机器人、智能座舱等场景的低成本本地推理成为可能。

💬 文章金句

- 教师模型更像是能力来源,而不是学生模型性能的上限。

  • 不一定。与单纯扩大模型规模相比,如何有效迁移和优化模型内部的多模态知识,可能更加关键。

📊 文章信息

AI 初评:80

来源:新智元

作者:新智元

分类:人工智能

语言:中文

阅读时间:16 分钟

字数:3904

标签: 多模态 AI, 模型训练与推理, 知识蒸馏, 情感识别, 边缘计算

阅读完整文章

查看原文 → 發佈: 2026-08-01 13:32:00 收錄: 2026-08-02 04:00:07

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。