← 回總覽

打通感知-理解-交互链路,全栈视频理解大模型 VideoChat3 开源了

📅 2026-07-22 12:00 机器之心 人工智能 2 分鐘 1593 字 評分: 85
视频理解 多模态大模型 视觉语言模型 时序建模 流式处理
📌 一句话摘要 南京大学等团队开源 VideoChat3,一个 4B 参数的全栈视频理解模型,通过 I3D-ViT 和自适应分辨率机制兼顾短视频、长视频和在线流式理解,并全面开源数据和代码。 📝 详细摘要 VideoChat3 由南京大学、上海人工智能实验室、南洋理工大学和北京大学联合发布,是一个面向通用视频理解的 4B 参数多模态大模型,围绕“全面、高效、开源”目标从视觉编码器架构、流式感知机制和训练数据体系三方面进行系统设计。其核心创新包括:提出 Inflated 3D Vision Transformer (I3D-ViT) 将时序建模前移至视觉编码阶段,实现约 16 倍时空压缩;设

📌 一句话摘要

南京大学等团队开源 VideoChat3,一个 4B 参数的全栈视频理解模型,通过 I3D-ViT 和自适应分辨率机制兼顾短视频、长视频和在线流式理解,并全面开源数据和代码。

📝 详细摘要

VideoChat3 由南京大学、上海人工智能实验室、南洋理工大学和北京大学联合发布,是一个面向通用视频理解的 4B 参数多模态大模型,围绕“全面、高效、开源”目标从视觉编码器架构、流式感知机制和训练数据体系三方面进行系统设计。其核心创新包括:提出 Inflated 3D Vision Transformer (I3D-ViT) 将时序建模前移至视觉编码阶段,实现约 16 倍时空压缩;设计自适应帧分辨率机制,通过 Silence/Standby/Response 三个状态驱动动态视觉预算分配,在流式理解中仅用 30%的高分辨率计算即取得更优时序定位性能;构建并开源三套高质量数据集(Academic2M、LV116K、OL617K),覆盖短视频、长视频和在线流式场景,配合四阶段渐进训练(视觉编码器预训练、视频-语言对齐、通用指令微调、长视频与流式微调),使模型在多项离线与在线视频理解基准上达到同规模领先水平。实验显示 VideoChat3 在 19 个可比指标中 18 个超越 Qwen3-VL-4B,在长视频场景中显著降低推理延迟与显存占用。研究团队已全面开放模型权重、代码和数据。

💡 主要观点

- VideoChat3 采用 I3D-ViT 将时序建模前移至视觉编码阶段,实现原生时空建模与高效压缩。 将连续帧划分为短时片段进行联合时空注意力,再沿时间维池化,相邻帧的运动线索与冗余在进入语言模型前得到整合,实现约 16 倍时空压缩。

自适应帧分辨率机制让模型根据证据充分性动态调整视觉预算,实现高效在线流式理解。 通过 Silence/Standby/Response 三个状态驱动闭环,无关片段用低分辨率,检测到线索后提升分辨率,以约 30%的视觉预算达到比固定高分辨率更好的时序定位性能。
研究团队构建了三套高质量专用数据集,覆盖短视频、长视频和流式视频场景,并全部开源。 Academic2M(改写学术数据为带证据回答)、LV116K(长视频事件账本)、OL617K(在线流式样本),共同提升模型细粒度理解、长程推理和主动响应能力。
VideoChat3 在多项基准上超越同规模开源模型,且在长视频中显著降低计算成本。 4B 参数在 19 个指标中 18 个超越 Qwen3-VL-4B;2048 帧时延迟从 44s 降至 20s,显存从 107GB 降至 81GB。

💬 文章金句

- 从'逐帧看图'迈向原生时空建模

  • 全面,高效,开源
  • VideoChat3 提供的并非这一问题的最终答案,而是一个高效、全面且可复现的开放起点。

📊 文章信息

AI 初评:85

来源:机器之心

作者:机器之心

分类:人工智能

语言:中文

阅读时间:18 分钟

字数:4276

标签: 视频理解, 多模态大模型, 视觉语言模型, 时序建模, 流式处理

阅读完整文章

查看原文 → 發佈: 2026-07-22 12:00:00 收錄: 2026-07-22 20:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。