← 回總覽

刚刚,谢赛宁团队放出第二代表征自编码器

📅 2026-05-21 11:03 机器之心 人工智能 2 分鐘 1925 字 評分: 88
RAEv2 表征自编码器 图像生成 扩散模型 视觉编码器
📌 一句话摘要 纽约大学谢赛宁团队联合 Adobe Research 与澳大利亚国立大学发布 RAEv2,通过融合多层编码器特征、互补 REPA 对齐损失以及利用 REPA 头实现免训练引导,将图像生成模型训练收敛速度提升 5-10 倍,同时保持极低计算成本。 📝 详细摘要 本文报道了纽约大学谢赛宁团队在 RAEv2 上的最新进展。RAEv2 是对第一代表征自编码器(RAE)的全面升级,旨在解决传统 VAE 在图像生成中效率低下的问题。文章首先指出 VAE 的瓶颈在于其潜在空间缺乏语义信息,而预训练视觉编码器(如 DINOv2)已具备丰富的视觉常识。RAEv2 基于三个核心洞察实现了系统性

📌 一句话摘要

纽约大学谢赛宁团队联合 Adobe Research 与澳大利亚国立大学发布 RAEv2,通过融合多层编码器特征、互补 REPA 对齐损失以及利用 REPA 头实现免训练引导,将图像生成模型训练收敛速度提升 5-10 倍,同时保持极低计算成本。

📝 详细摘要

本文报道了纽约大学谢赛宁团队在 RAEv2 上的最新进展。RAEv2 是对第一代表征自编码器(RAE)的全面升级,旨在解决传统 VAE 在图像生成中效率低下的问题。文章首先指出 VAE 的瓶颈在于其潜在空间缺乏语义信息,而预训练视觉编码器(如 DINOv2)已具备丰富的视觉常识。RAEv2 基于三个核心洞察实现了系统性改进:一是将编码器最后 K 层的特征直接相加作为潜在表征,显著提升重建质量;二是发现 RAE 与 REPA 并非竞争关系,而是互补的,前者提供全局语义,后者提供空间结构;三是利用 REPA 头作为引导基线,实现了无需额外训练的免费引导机制。实验结果表明,RAEv2 在 ImageNet-256 上仅需 80 个训练 epoch 即可达到 1.06 的 gFID,收敛速度比原始 RAE 快 5 倍以上,且计算成本仅为 FLUX.1 等商业模型的一半。此外,RAEv2 在文本生图和导航世界模型等任务上也展现出良好的泛化能力。文章最后指出,RAE 框架的核心意义在于统一了图像理解与生成的底层表征,为下一代多模态 AI 提供了新的思路。

💡 主要观点

- RAEv2 通过融合多层编码器特征,显著提升了图像重建质量。 原始 RAE 仅使用编码器最后一层输出,丢失了中间层的细节信息。RAEv2 将最后 K 层特征直接相加,当 K 从 1 增加到 23 时,重建误差(rFID)从 0.60 骤降至 0.18,峰值信噪比从 18.93 dB 提升至 27.03 dB,且不引入任何新参数。

RAE 与 REPA 是互补机制,同时使用效果最佳。 RAE 提供全局语义信息(如图像内容),REPA 提供空间结构信息(如物体位置)。在 27 种编码器上的实验验证了这种互补性,皮尔逊相关系数分别达到 -0.81 和 -0.89。两者结合能充分发挥更强编码器(如 DINOv3-L)的潜力。
RAEv2 实现了免训练的免费引导机制。 通过将主模型输出改写为 x 预测格式,并利用 REPA 头作为引导基线,RAEv2 无需额外训练模型或增加前向计算,即可实现有效的引导,解决了原始 RAE 无法使用标准 CFG 的问题。
RAEv2 将训练收敛速度提升 5-10 倍,且计算成本极低。 在 ImageNet-256 上,RAEv2 仅需 35 个 epoch 即可达到无引导 gFID ≤ 2,而原始 RAE 需要 177 个 epoch。其计算成本为 189 GFLOPs,不到 FLUX.1(448 GFLOPs)的一半,实现了效率与质量的平衡。

💬 文章金句

- RAEv2 提出了一个极其简洁的解法:将编码器最后 K 层的特征直接相加,作为潜在表征。这个操作不引入任何新参数,不需要额外训练数据,却让图像重建质量产生了质的飞跃。

  • RAE 提供的是「全局语义」...REPA 提供的是「空间结构」...前者对应语义信息,后者对应空间自相似性。
  • RAEv2 观察到一个关键性质:REPA 在 RAE 框架下,本质上是在做「x 预测」...将主模型输出也改写为 x 预测格式,就可以直接用 REPA 头作为引导基线。
  • RAEv2 所指向的不只是「更快的图像生成」...下一代多模态 AI 是否应当从根本上统一「看」与「画」的底层表征?

📊 文章信息

AI 初评:88

来源:机器之心

作者:机器之心

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2961

标签: RAEv2, 表征自编码器, 图像生成, 扩散模型, 视觉编码器

阅读完整文章

查看原文 → 發佈: 2026-05-21 11:03:00 收錄: 2026-05-21 18:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。