兔展智能联合北大、鹏城实验室提出 UniWorld-View 模型,通过遮挡感知点云渲染和双流条件注入实现单目视频的任意视角合成及 4D 重建,并开源代码并适配国产昇腾算力。
📝 详细摘要
文章介绍了兔展智能团队与北大、鹏城实验室合作推出的 UniWorld-View 世界模型,该模型能够从单张图片或短视频生成任意视角的视频,实现推、拉、摇、移甚至 360°环绕的精确相机位姿控制。文章详细阐释了当前新视角合成在大基线情况下的两大难点——前景背景撕裂和背面漏光,并提出了双重投影解决撕裂、法向过滤解决漏光的两项创新点云渲染技术。随后通过双流条件注入(几何流与外观流)将几何约束与外观细节有效结合,进一步提出将时间与空间解耦的“先拍定妆照、再开机拍动态”策略,使得单目视频可直接生成可自由视角漫游的 4D 场景。文中还介绍了团队背景、模型的开源情况(代码和权重全部开源)、之前的 Open-Sora Plan 及 UniWorld 系列模型的贡献,以及未来将推出的产品化工具 RabbitVis。
💡 主要观点
- 提出遮挡感知点云渲染(Occlusion-aware Point Cloud Rendering)解决大基线新视角合成的撕裂与漏光问题。 通过双重投影生成遮挡 mask 剔除错误纹理,并利用法向过滤剔除背对相机的点云点,使条件图像仅保留可靠几何信息。
💬 文章金句
- 你随手拍一段视频,或者干脆只给一张图,它还你一段“相机轨迹任你指定”的新视角视频------
- 推、拉、摇、移,甚至‘绕着场景 360°转一圈’都可以,提供‘精确听话的相机位姿控制’。
- 唯一的难点全在‘大基线(large-baseline)’三个字上------
- 双重投影(Double-Reprojection),专治撕裂。
- 法向过滤,专治背面漏光。
- 双流条件注入:几何流——点云渲染图+mask,编码后加到潜变量上,负责把生成内容死死钉在 3D 结构上;外观流——源视频走新设计的‘Ref-DiT 模块’——新视角特征当 Query,源视频特征当 Key/Value 做 cross-attention,让模型自己去原视频里‘翻素材’,哪儿缺补哪儿,连点云伪影造成的糊纹理都能顺手修掉。
- 单目随手拍→可自由视角漫游的 4D 场景,一条龙打通。
📊 文章信息
AI 初评:81
来源:量子位
作者:思邈
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2335
标签: 人工智能, 世界模型, 视频生成, 3D重建, 开源模型