← 回總覽

ICLR 2026|美图提出位置编码场 PE-Field ,让 DiT 感知和控制 3D 空间

📅 2026-06-15 18:47 AI科技评论 人工智能 2 分鐘 1313 字 評分: 82
AI 研究 扩散模型 3D 视觉 新视角合成 位置编码
📌 一句话摘要 美图影像研究院联合德州大学奥斯汀分校提出 PE-Field,一种将 DiT 的 2D 位置编码扩展为结构化 3D 场的新框架,以提升模型的空间感知与可控性,已被 ICLR 2026 收录。 📝 详细摘要 本文介绍了一项被 ICLR 2026 收录的研究成果——PE-Field(位置编码场),由美图影像研究院(MT Lab)与德克萨斯大学奥斯汀分校联合提出。文章首先指出当前 Diffusion Transformer(DiT)在处理图像时,Patch Token 的位置编码主要局限于 2D 平面,导致模型在理解 3D 空间结构、视角变化等方面存在局限。研究团队通过实验发现,位

📌 一句话摘要

美图影像研究院联合德州大学奥斯汀分校提出 PE-Field,一种将 DiT 的 2D 位置编码扩展为结构化 3D 场的新框架,以提升模型的空间感知与可控性,已被 ICLR 2026 收录。

📝 详细摘要

本文介绍了一项被 ICLR 2026 收录的研究成果——PE-Field(位置编码场),由美图影像研究院(MT Lab)与德克萨斯大学奥斯汀分校联合提出。文章首先指出当前 Diffusion Transformer(DiT)在处理图像时,Patch Token 的位置编码主要局限于 2D 平面,导致模型在理解 3D 空间结构、视角变化等方面存在局限。研究团队通过实验发现,位置编码对生成图像的空间连贯性起关键引导作用。基于此,他们设计了 PE-Field 框架,核心包含两个模块:深度感知编码(引入 Z 轴深度信息,使模型具备体积推理能力)和层次化编码(在更精细的层面建模几何结构)。该框架能在较少改动核心网络架构的情况下,增强 DiT 的 3D 感知能力。实验表明,PE-Field 在新视角合成(NVS)任务中表现具有竞争力,并在物体编辑、物体消除等可控空间图像编辑任务中展现了良好的泛化能力。文章最后介绍了美图在将此类前沿研究落地到其影像产品(如美图秀秀、Wink 等)中的商业化路径。

💡 主要观点

- PE-Field 将 DiT 的 2D 位置编码扩展为结构化 3D 场。 通过引入深度感知编码(Z 轴)和层次化编码,使模型能够直接处理 3D 空间中的几何信息,提升空间理解能力。

位置编码对生成图像的空间连贯性起关键引导作用。 实验发现,扰动位置编码会改变图像的空间结构,但语义仍连贯,表明位置编码是控制空间布局的核心。
PE-Field 在新视角合成和空间编辑任务中表现良好。 该方法在单张图像的新视角生成上具有竞争力,并能灵活应用于物体位置编辑、物体消除等任务,展示了较好的泛化性。

💬 文章金句

- PE-Field 将传统的 2D 位置编码扩展为结构化的 3D 场,使 DiT 能够更加直接地在 3D 空间中处理几何信息。

  • 生成图像的空间连贯性,在很大程度上受到位置编码的引导。

📊 文章信息

AI 初评:82

来源:AI科技评论

作者:AI科技评论

分类:人工智能

语言:中文

阅读时间:10 分钟

字数:2304

标签: AI 研究, 扩散模型, 3D 视觉, 新视角合成, 位置编码

阅读完整文章

查看原文 → 發佈: 2026-06-15 18:47:00 收錄: 2026-06-15 20:00:31

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。