字节跳动商业化技术团队提出生成精炼网络 GRN,一种融合扩散模型与自回归模型优势的视觉生成新范式,通过层次二叉树量化、全局精炼和复杂度感知采样,实现了边画边改、简单少画复杂多画的智能生成。
📝 详细摘要
本文介绍了字节跳动商业化技术团队提出的视觉生成新范式——生成精炼网络 GRN。GRN 旨在融合扩散模型的高质量生成与自回归模型的复杂度感知能力,同时解决两者的固有缺陷。其核心架构包括三个部分:层次二叉树量化 HBQ,实现近乎无损的离散编码,避免信息损失;全局精炼网络 GRN,通过模拟人类绘画的边画边改过程,引入 token 精调机制,彻底解决自回归模型的误差累积问题;复杂度感知采样,利用熵衡量画面复杂度,实现简单样本少步数、复杂样本多步数的自适应计算分配。实验结果显示,GRN 在 ImageNet 类别生成、文生图、文生视频等多项基准测试中均刷新 SOTA 记录,尤其在同等参数量下超越了主流扩散模型和自回归模型。文章还探讨了 GRN 对 dLLM 的潜在启发,以及其在统一多模态 token 方面的长远意义。
💡 主要观点
- GRN 提出视觉生成的第三条技术路线,融合扩散与自回归模型优势。 GRN 旨在结合扩散模型的高质量生成与自回归模型的复杂度感知能力,同时通过全局精炼机制解决自回归的误差累积问题,并通过复杂度感知采样解决扩散模型的计算资源浪费问题。
💬 文章金句
- GRN 则从根本上解决了这些问题,知错就改,可以在画的过程中就不断修改细化,直到满意为止。
- 通过这个全局 refine 的更新机制,确定的 token 不断增多,不确定的 token 反复改写,就像一个画家一样,真正做到了边画边改。
- 它证明,在扩散和自回归这两条既定路径之外,视觉生成还有新的可能。
- GRN 同时解决了量化损失、误差累计、复杂度感知生成的三个问题,在 AR 和 Diffusion 中间架起了一座桥梁。
📊 文章信息
AI 初评:88
来源:量子位
作者:鹭羽
分类:人工智能
语言:中文
阅读时间:17 分钟
字数:4172
标签: 视觉生成, GRN, 扩散模型, 自回归模型, 字节跳动