南京大学等团队开源 VideoChat3,一个 4B 参数的全栈视频理解模型,通过 I3D-ViT 和自适应分辨率机制兼顾短视频、长视频和在线流式理解,并全面开源数据和代码。
📝 详细摘要
VideoChat3 由南京大学、上海人工智能实验室、南洋理工大学和北京大学联合发布,是一个面向通用视频理解的 4B 参数多模态大模型,围绕“全面、高效、开源”目标从视觉编码器架构、流式感知机制和训练数据体系三方面进行系统设计。其核心创新包括:提出 Inflated 3D Vision Transformer (I3D-ViT) 将时序建模前移至视觉编码阶段,实现约 16 倍时空压缩;设计自适应帧分辨率机制,通过 Silence/Standby/Response 三个状态驱动动态视觉预算分配,在流式理解中仅用 30%的高分辨率计算即取得更优时序定位性能;构建并开源三套高质量数据集(Academic2M、LV116K、OL617K),覆盖短视频、长视频和在线流式场景,配合四阶段渐进训练(视觉编码器预训练、视频-语言对齐、通用指令微调、长视频与流式微调),使模型在多项离线与在线视频理解基准上达到同规模领先水平。实验显示 VideoChat3 在 19 个可比指标中 18 个超越 Qwen3-VL-4B,在长视频场景中显著降低推理延迟与显存占用。研究团队已全面开放模型权重、代码和数据。
💡 主要观点
- VideoChat3 采用 I3D-ViT 将时序建模前移至视觉编码阶段,实现原生时空建模与高效压缩。 将连续帧划分为短时片段进行联合时空注意力,再沿时间维池化,相邻帧的运动线索与冗余在进入语言模型前得到整合,实现约 16 倍时空压缩。
💬 文章金句
- 从'逐帧看图'迈向原生时空建模
- 全面,高效,开源
- VideoChat3 提供的并非这一问题的最终答案,而是一个高效、全面且可复现的开放起点。
📊 文章信息
AI 初评:85
来源:机器之心
作者:机器之心
分类:人工智能
语言:中文
阅读时间:18 分钟
字数:4276
标签: 视频理解, 多模态大模型, 视觉语言模型, 时序建模, 流式处理