北大、港中文、上海 AI Lab 等机构提出 VGGT-Edit 框架,通过残差场预测和深度同步文本注入,在 3D 空间内直接完成编辑,实现 5 秒单次编辑和 120 倍加速。
📝 详细摘要
文章介绍了由北京大学、香港中文大学、上海 AI Lab 等机构联合提出的 VGGT-Edit,一种原生 3D 编辑框架。当前主流 3D 编辑方法多基于 2D 图像逐帧处理再拼回 3D,导致多视角不一致、背景漂移等问题。VGGT-Edit 的核心创新在于直接在 3D 空间内进行编辑,通过残差场预测机制,仅学习场景中需要变化的局部区域,保持未改动背景的稳定性。同时,框架引入深度同步文本注入,让文本语义与 3D 空间特征在多个深度层级持续对齐,并设计了视角重要性加权机制以提升多视角一致性。团队还构建了 10 万规模的 DeltaScene 数据集用于训练。实验表明,VGGT-Edit 在语义一致性、多视角稳定性和推理速度上均超越现有方法,单次编辑仅需约 5 秒,最高实现 120 倍加速,并展现出对未见编辑指令的泛化能力。
💡 主要观点
- VGGT-Edit 直接在 3D 空间内完成编辑,而非绕回 2D 逐帧处理。 传统方法将 3D 场景拆解为多张 2D 图像分别编辑再拼合,易导致多视角不一致和背景漂移。VGGT-Edit 基于前馈式 3D 重建模型,直接在 3D 表示空间操作,从根本上解决了这一问题。
💬 文章金句
- 核心思路只有一句话——不再绕回 2D,而是直接在 3D 空间里完成编辑。
- 模型先保留原始场景稳定的 3D 结构,然后只学习'哪里需要变化'。
- VGGT-Edit 会自动判断哪个视角更值得信任,最终让多视角编辑结果更加稳定。
- 这意味着编 3D 第一次真正开始接近实时交互。
- 它真正开始理解文本语义如何映射到 3D 空间变化。
📊 文章信息
AI 初评:86
来源:量子位
作者:听雨
分类:人工智能
语言:中文
阅读时间:11 分钟
字数:2665
标签: 3D 编辑, VGGT-Edit, 残差场预测, 前馈式重建, DeltaScene