格灵深瞳灵感实验室分享了其在低成本全帧率视频理解上的技术突破,以及从 CV 到多模态时代,如何通过分层部署策略解决真实业务落地的工程化思考。
📝 详细摘要
本文是 InfoQ 对格灵深瞳灵感实验室的深度访谈。文章核心围绕两个层面展开:技术层面,灵感实验室介绍了其最新成果 LLaVA-OneVision-2.0,该模型通过 OneVision-Encoder 利用视频 codec 中已有的 I 帧、P 帧等结构信息,实现了低成本的全帧率视频理解,在保持效果的同时将推理 token 成本降至约 1/8。团队认为,当前主流抽帧方案会丢失关键时序信息,而将视频拆帧再让模型重新理解帧间关系的方式存在巨大算力浪费。业务层面,格灵深瞳推出了「视觉智能工坊」软硬一体系统,采用「边缘哨兵-算法运营中心-算法训练中心」的三层架构,并提出了「大模型冷启动、中等模型快速迭代、小模型规模化部署」的分层落地策略,以解决银行、安防等场景中长尾、非标需求的成本与效率问题。文章还探讨了 CV 时代积累的表征学习、token 效率等问题在多模态时代被低估的价值。
💡 主要观点
- 低成本全帧率视频理解的核心瓶颈在于 token 数量,抽帧会丢失关键时序信息。 传统方法按固定间隔抽帧,会遗漏短时关键动作。全帧率输入虽能保留完整信息,但会迅速耗尽模型上下文窗口和算力,因此需要更高效的视觉编码策略。
💬 文章金句
- 图像只是一个瞬间,它前后的连续关系没有在前端建模起来,而是都丢给后端模型去理解。
- 既然视频原来已经有建模好的东西,为什么不直接用这些东西,在上面构建更 compact 的 token,或者更 compact 的表示?
- 理解是底座。只有底座足够好,上层的「生成」和「理解」才能拥有更高的上限。
📊 文章信息
AI 初评:88
来源:InfoQ 中文
作者:InfoQ 中文
分类:人工智能
语言:中文
阅读时间:49 分钟
字数:12103
标签: 全帧率视频理解, LLaVA-OneVision-2.0, 视觉编码器, VLM, 模型部署