← 回總覽

CVPR 2026 | 火山引擎多媒体实验室提出 TempR1,显著增强多模态大模型视频时序理解能力

📅 2026-04-13 18:05 字节跳动技术团队 人工智能 2 分鐘 1428 字 評分: 89
多模态大模型 视频理解 时序推理 强化学习 多任务学习
📌 一句话摘要 本文介绍了火山引擎多媒体实验室与南京大学联合提出的 TempR1 方法,该方法通过多任务强化学习框架和定制化时序奖励设计,系统性提升了多模态大模型在五大视频时序理解任务上的性能与泛化能力。 📝 详细摘要 文章详细阐述了针对多模态大模型视频时序理解能力不足的解决方案 TempR1。该方法的核心创新在于构建了一个覆盖五大时序任务(时序定位、稠密时序定位、时序动作定位、视频亮点检测、基于定位的视频问答)的语料库,并基于 Group Relative Policy Optimization 算法,设计了针对不同时序区间-实例对应关系(一对一、多对一、多对多)的定制化奖励函数。实验结

📌 一句话摘要

本文介绍了火山引擎多媒体实验室与南京大学联合提出的 TempR1 方法,该方法通过多任务强化学习框架和定制化时序奖励设计,系统性提升了多模态大模型在五大视频时序理解任务上的性能与泛化能力。

📝 详细摘要

文章详细阐述了针对多模态大模型视频时序理解能力不足的解决方案 TempR1。该方法的核心创新在于构建了一个覆盖五大时序任务(时序定位、稠密时序定位、时序动作定位、视频亮点检测、基于定位的视频问答)的语料库,并基于 Group Relative Policy Optimization 算法,设计了针对不同时序区间-实例对应关系(一对一、多对一、多对多)的定制化奖励函数。实验结果表明,TempR1 在多个公共基准数据集上均取得了当前最优性能,同时保持了模型的通用视频理解能力,验证了多任务协同训练的有效性。该研究为长视频分析和智能视频检索等应用提供了更强的技术支撑。

💡 主要观点

- 现有视频时序理解方法存在监督微调易过拟合、强化学习任务单一且泛化弱的局限。 SFT 方法在有限时序数据上易过拟合并损害通用能力;传统 RL 方法多聚焦单一任务,无法支持复杂场景和捕捉时序依赖的层级特性。

TempR1 的核心创新是结合多任务协同训练与精细化时序奖励设计。 方法构建了覆盖五大任务的语料库,并依据预测与真实区间的对应关系(一对一、多对一、多对多)设计专属定位奖励,在统一强化学习框架下进行联合优化。
实验证明 TempR1 在五大时序任务上全面领先,且多任务训练具有强协同效应。 在多个基准数据集上取得 SOTA 性能,消融实验显示随着训练任务增加,模型性能持续提升,验证了跨任务知识迁移的有效性,同时保持了通用视频理解能力。
该方法为多模态大模型的时序推理优化提供了可扩展的新范式。 通过系统性的多任务强化学习框架,解决了现有方法泛化性差、扩展性弱的问题,为长视频分析等实际应用奠定了技术基础。

💬 文章金句

- TempR1——一种基于时序感知多任务强化学习的全新方法,系统性地增强了多模态大模型在各类视频时序理解任务中的推理能力。

  • 根据预测区间与真实实例的对应关系,将时序定位任务划分为一对一、多对一、多对多三种类型,并为每类设计专属的时序定位奖励函数,精准匹配不同任务的时序特性。
  • 消融实验证明,随着训练任务数量增加,模型在各基准上的性能持续提升,五大任务联合训练时效果最优,验证了不同时序任务间的知识迁移和能力互补。
  • TempR1 的强化微调在提升时序理解的同时,在 VideoMME、MVBench 等通用视频理解基准上的表现也显著优于基础模型和 SFT 模型。

📊 文章信息

AI 初评:89

来源:字节跳动技术团队

作者:字节跳动技术团队

分类:人工智能

语言:中文

阅读时间:9 分钟

字数:2031

标签: 多模态大模型, 视频理解, 时序推理, 强化学习, 多任务学习

阅读完整文章

查看原文 → 發佈: 2026-04-13 18:05:00 收錄: 2026-04-13 22:00:41

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。