← 回總覽

国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源

📅 2026-07-24 22:19 思邈 人工智能 2 分鐘 1792 字 評分: 81
人工智能 世界模型 视频生成 3D重建 开源模型
📌 一句话摘要 兔展智能联合北大、鹏城实验室提出 UniWorld-View 模型,通过遮挡感知点云渲染和双流条件注入实现单目视频的任意视角合成及 4D 重建,并开源代码并适配国产昇腾算力。 📝 详细摘要 文章介绍了兔展智能团队与北大、鹏城实验室合作推出的 UniWorld-View 世界模型,该模型能够从单张图片或短视频生成任意视角的视频,实现推、拉、摇、移甚至 360°环绕的精确相机位姿控制。文章详细阐释了当前新视角合成在大基线情况下的两大难点——前景背景撕裂和背面漏光,并提出了双重投影解决撕裂、法向过滤解决漏光的两项创新点云渲染技术。随后通过双流条件注入(几何流与外观流)将几何约束与

📌 一句话摘要

兔展智能联合北大、鹏城实验室提出 UniWorld-View 模型,通过遮挡感知点云渲染和双流条件注入实现单目视频的任意视角合成及 4D 重建,并开源代码并适配国产昇腾算力。

📝 详细摘要

文章介绍了兔展智能团队与北大、鹏城实验室合作推出的 UniWorld-View 世界模型,该模型能够从单张图片或短视频生成任意视角的视频,实现推、拉、摇、移甚至 360°环绕的精确相机位姿控制。文章详细阐释了当前新视角合成在大基线情况下的两大难点——前景背景撕裂和背面漏光,并提出了双重投影解决撕裂、法向过滤解决漏光的两项创新点云渲染技术。随后通过双流条件注入(几何流与外观流)将几何约束与外观细节有效结合,进一步提出将时间与空间解耦的“先拍定妆照、再开机拍动态”策略,使得单目视频可直接生成可自由视角漫游的 4D 场景。文中还介绍了团队背景、模型的开源情况(代码和权重全部开源)、之前的 Open-Sora Plan 及 UniWorld 系列模型的贡献,以及未来将推出的产品化工具 RabbitVis。

💡 主要观点

- 提出遮挡感知点云渲染(Occlusion-aware Point Cloud Rendering)解决大基线新视角合成的撕裂与漏光问题。 通过双重投影生成遮挡 mask 剔除错误纹理,并利用法向过滤剔除背对相机的点云点,使条件图像仅保留可靠几何信息。

设计双流条件注入机制,将几何流与外观流分别引入扩散模型,实现结构精准与外观保真。 几何流将点云渲染图+mask 编码后注入潜变量,锁定 3D 结构;外观流使用 Ref-DiT 模块进行跨注意力,从源视频中动态补全缺失细节,兼顾几何一致性与纹理丰富度。
提出时间-空间解耦的生成策略:先生成静态环绕视图作为外观锚点,再在固定机位上生成同步多视角视频,最终通过 4DGS 优化得到完整 4D 场景。 将时间冻结生成全场景外观参考图,再在固定视角下生成多视角动态序列,使单目视频能够直接转换为可自由视角漫游的 4D 重建结果。
模型代码与权重全部开源,并已适配国产昇腾算力,便于国内研究者和开发者直接使用与二次开发。 文章提供了官方仓库链接(PKU-YuanGroup/UniWorld-View),并指出团队此前已推出开源文生视频模型 Open-Sora Plan,展示其在视觉大模型领域的持续贡献与开源精神。

💬 文章金句

- 你随手拍一段视频,或者干脆只给一张图,它还你一段“相机轨迹任你指定”的新视角视频------

  • 推、拉、摇、移,甚至‘绕着场景 360°转一圈’都可以,提供‘精确听话的相机位姿控制’。
  • 唯一的难点全在‘大基线(large-baseline)’三个字上------
  • 双重投影(Double-Reprojection),专治撕裂。
  • 法向过滤,专治背面漏光。
  • 双流条件注入:几何流——点云渲染图+mask,编码后加到潜变量上,负责把生成内容死死钉在 3D 结构上;外观流——源视频走新设计的‘Ref-DiT 模块’——新视角特征当 Query,源视频特征当 Key/Value 做 cross-attention,让模型自己去原视频里‘翻素材’,哪儿缺补哪儿,连点云伪影造成的糊纹理都能顺手修掉。
  • 单目随手拍→可自由视角漫游的 4D 场景,一条龙打通。

📊 文章信息

AI 初评:81

来源:量子位

作者:思邈

分类:人工智能

语言:中文

阅读时间:10 分钟

字数:2335

标签: 人工智能, 世界模型, 视频生成, 3D重建, 开源模型

阅读完整文章

查看原文 → 發佈: 2026-07-24 22:19:06 收錄: 2026-07-25 00:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。