美图影像研究院联合德州大学奥斯汀分校提出 PE-Field,一种将 DiT 的 2D 位置编码扩展为结构化 3D 场的新框架,以提升模型的空间感知与可控性,已被 ICLR 2026 收录。
📝 详细摘要
本文介绍了一项被 ICLR 2026 收录的研究成果——PE-Field(位置编码场),由美图影像研究院(MT Lab)与德克萨斯大学奥斯汀分校联合提出。文章首先指出当前 Diffusion Transformer(DiT)在处理图像时,Patch Token 的位置编码主要局限于 2D 平面,导致模型在理解 3D 空间结构、视角变化等方面存在局限。研究团队通过实验发现,位置编码对生成图像的空间连贯性起关键引导作用。基于此,他们设计了 PE-Field 框架,核心包含两个模块:深度感知编码(引入 Z 轴深度信息,使模型具备体积推理能力)和层次化编码(在更精细的层面建模几何结构)。该框架能在较少改动核心网络架构的情况下,增强 DiT 的 3D 感知能力。实验表明,PE-Field 在新视角合成(NVS)任务中表现具有竞争力,并在物体编辑、物体消除等可控空间图像编辑任务中展现了良好的泛化能力。文章最后介绍了美图在将此类前沿研究落地到其影像产品(如美图秀秀、Wink 等)中的商业化路径。
💡 主要观点
- PE-Field 将 DiT 的 2D 位置编码扩展为结构化 3D 场。 通过引入深度感知编码(Z 轴)和层次化编码,使模型能够直接处理 3D 空间中的几何信息,提升空间理解能力。
💬 文章金句
- PE-Field 将传统的 2D 位置编码扩展为结构化的 3D 场,使 DiT 能够更加直接地在 3D 空间中处理几何信息。
- 生成图像的空间连贯性,在很大程度上受到位置编码的引导。
📊 文章信息
AI 初评:82
来源:AI科技评论
作者:AI科技评论
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2304
标签: AI 研究, 扩散模型, 3D 视觉, 新视角合成, 位置编码