← 回總覽

5 秒完成 3D 场景编辑,北大&港中文&上海 AI Lab 搞出 VGGT-Edit,120 倍加速太炸了

📅 2026-05-27 17:01 听雨 人工智能 2 分鐘 1546 字 評分: 86
3D 编辑 VGGT-Edit 残差场预测 前馈式重建 DeltaScene
📌 一句话摘要 北大、港中文、上海 AI Lab 等机构提出 VGGT-Edit 框架,通过残差场预测和深度同步文本注入,在 3D 空间内直接完成编辑,实现 5 秒单次编辑和 120 倍加速。 📝 详细摘要 文章介绍了由北京大学、香港中文大学、上海 AI Lab 等机构联合提出的 VGGT-Edit,一种原生 3D 编辑框架。当前主流 3D 编辑方法多基于 2D 图像逐帧处理再拼回 3D,导致多视角不一致、背景漂移等问题。VGGT-Edit 的核心创新在于直接在 3D 空间内进行编辑,通过残差场预测机制,仅学习场景中需要变化的局部区域,保持未改动背景的稳定性。同时,框架引入深度同步文本注入

📌 一句话摘要

北大、港中文、上海 AI Lab 等机构提出 VGGT-Edit 框架,通过残差场预测和深度同步文本注入,在 3D 空间内直接完成编辑,实现 5 秒单次编辑和 120 倍加速。

📝 详细摘要

文章介绍了由北京大学、香港中文大学、上海 AI Lab 等机构联合提出的 VGGT-Edit,一种原生 3D 编辑框架。当前主流 3D 编辑方法多基于 2D 图像逐帧处理再拼回 3D,导致多视角不一致、背景漂移等问题。VGGT-Edit 的核心创新在于直接在 3D 空间内进行编辑,通过残差场预测机制,仅学习场景中需要变化的局部区域,保持未改动背景的稳定性。同时,框架引入深度同步文本注入,让文本语义与 3D 空间特征在多个深度层级持续对齐,并设计了视角重要性加权机制以提升多视角一致性。团队还构建了 10 万规模的 DeltaScene 数据集用于训练。实验表明,VGGT-Edit 在语义一致性、多视角稳定性和推理速度上均超越现有方法,单次编辑仅需约 5 秒,最高实现 120 倍加速,并展现出对未见编辑指令的泛化能力。

💡 主要观点

- VGGT-Edit 直接在 3D 空间内完成编辑,而非绕回 2D 逐帧处理。 传统方法将 3D 场景拆解为多张 2D 图像分别编辑再拼合,易导致多视角不一致和背景漂移。VGGT-Edit 基于前馈式 3D 重建模型,直接在 3D 表示空间操作,从根本上解决了这一问题。

残差场预测机制仅学习局部变化,保持未改动区域的稳定性。 模型保留原始场景的稳定 3D 结构,只预测需要变化的局部残差场,如物体移动、材质修改或删除。这使得大部分无需编辑的背景区域保持高度稳定,避免了全局重生成带来的不确定性。
深度同步文本注入实现文本语义与 3D 空间的持续对齐。 传统方法仅在初期注入文本信息,VGGT-Edit 在多个关键深度层级持续融合文本语义,确保模型在整个编辑过程中始终知道修改区域、目标和空间位置,提升了编辑的语义准确性。
单次编辑仅需约 5 秒,最高实现 120 倍加速,接近实时交互。 相比需要长时间优化的传统方法,VGGT-Edit 的推理速度极快,使 3D 编辑首次接近实时交互,对机器人、数字孪生、AR/VR 等需要快速迭代的应用场景意义重大。

💬 文章金句

- 核心思路只有一句话——不再绕回 2D,而是直接在 3D 空间里完成编辑。

  • 模型先保留原始场景稳定的 3D 结构,然后只学习'哪里需要变化'。
  • VGGT-Edit 会自动判断哪个视角更值得信任,最终让多视角编辑结果更加稳定。
  • 这意味着编 3D 第一次真正开始接近实时交互。
  • 它真正开始理解文本语义如何映射到 3D 空间变化。

📊 文章信息

AI 初评:86

来源:量子位

作者:听雨

分类:人工智能

语言:中文

阅读时间:11 分钟

字数:2665

标签: 3D 编辑, VGGT-Edit, 残差场预测, 前馈式重建, DeltaScene

阅读完整文章

查看原文 → 發佈: 2026-05-27 17:01:54 收錄: 2026-05-27 20:00:37

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。