← 回總覽

挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改

📅 2026-05-13 22:04 鹭羽 人工智能 2 分鐘 1729 字 評分: 88
视觉生成 GRN 扩散模型 自回归模型 字节跳动
📌 一句话摘要 字节跳动商业化技术团队提出生成精炼网络 GRN,一种融合扩散模型与自回归模型优势的视觉生成新范式,通过层次二叉树量化、全局精炼和复杂度感知采样,实现了边画边改、简单少画复杂多画的智能生成。 📝 详细摘要 本文介绍了字节跳动商业化技术团队提出的视觉生成新范式——生成精炼网络 GRN。GRN 旨在融合扩散模型的高质量生成与自回归模型的复杂度感知能力,同时解决两者的固有缺陷。其核心架构包括三个部分:层次二叉树量化 HBQ,实现近乎无损的离散编码,避免信息损失;全局精炼网络 GRN,通过模拟人类绘画的边画边改过程,引入 token 精调机制,彻底解决自回归模型的误差累积问题;复杂度

📌 一句话摘要

字节跳动商业化技术团队提出生成精炼网络 GRN,一种融合扩散模型与自回归模型优势的视觉生成新范式,通过层次二叉树量化、全局精炼和复杂度感知采样,实现了边画边改、简单少画复杂多画的智能生成。

📝 详细摘要

本文介绍了字节跳动商业化技术团队提出的视觉生成新范式——生成精炼网络 GRN。GRN 旨在融合扩散模型的高质量生成与自回归模型的复杂度感知能力,同时解决两者的固有缺陷。其核心架构包括三个部分:层次二叉树量化 HBQ,实现近乎无损的离散编码,避免信息损失;全局精炼网络 GRN,通过模拟人类绘画的边画边改过程,引入 token 精调机制,彻底解决自回归模型的误差累积问题;复杂度感知采样,利用熵衡量画面复杂度,实现简单样本少步数、复杂样本多步数的自适应计算分配。实验结果显示,GRN 在 ImageNet 类别生成、文生图、文生视频等多项基准测试中均刷新 SOTA 记录,尤其在同等参数量下超越了主流扩散模型和自回归模型。文章还探讨了 GRN 对 dLLM 的潜在启发,以及其在统一多模态 token 方面的长远意义。

💡 主要观点

- GRN 提出视觉生成的第三条技术路线,融合扩散与自回归模型优势。 GRN 旨在结合扩散模型的高质量生成与自回归模型的复杂度感知能力,同时通过全局精炼机制解决自回归的误差累积问题,并通过复杂度感知采样解决扩散模型的计算资源浪费问题。

层次二叉树量化 HBQ 实现近乎无损的离散编码。 HBQ 通过二叉树结构进行多轮二进制量化,量化误差随轮数指数级衰减,理论上可实现完全无损量化,解决了自回归模型因离散 token 化导致的信息损失问题。
全局精炼网络通过 token 精调机制模拟人类边画边改的创作过程。 GRN 从随机 token 图开始,逐轮迭代,模型自主判断已画好的 token 和待画的 token,对不确定的 token 进行反复改写,最终生成高质量结果,彻底解决了自回归模型早期错误无法修正的问题。
复杂度感知采样实现自适应计算分配,简单少画、复杂多画。 GRN 利用每一步预测的平均熵来衡量画面复杂度,熵低则分配较少推理步数,熵高则分配更多步数,在 130M 模型上平均推理步数从 50 步降至 24 步,而生成质量仅略微下降。
GRN 在多项基准测试中刷新 SOTA,证明离散 token 在视觉生成中的潜力。 在 ImageNet 类别生成、文生图、文生视频等任务中,GRN 在同等参数量下超越主流扩散模型和自回归模型,证明了纯血离散 token 能够做好图像和视频生成,为统一多模态 token 提供了新思路。

💬 文章金句

- GRN 则从根本上解决了这些问题,知错就改,可以在画的过程中就不断修改细化,直到满意为止。

  • 通过这个全局 refine 的更新机制,确定的 token 不断增多,不确定的 token 反复改写,就像一个画家一样,真正做到了边画边改。
  • 它证明,在扩散和自回归这两条既定路径之外,视觉生成还有新的可能。
  • GRN 同时解决了量化损失、误差累计、复杂度感知生成的三个问题,在 AR 和 Diffusion 中间架起了一座桥梁。

📊 文章信息

AI 初评:88

来源:量子位

作者:鹭羽

分类:人工智能

语言:中文

阅读时间:17 分钟

字数:4172

标签: 视觉生成, GRN, 扩散模型, 自回归模型, 字节跳动

阅读完整文章

查看原文 → 發佈: 2026-05-13 22:04:35 收錄: 2026-05-14 00:00:02

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。