[论文解读] Autoregressive Image Generation without Vector Quantization
本文提出了一种新颖的扩散损失(Diffusion Loss),用于自回归图像生成,通过使用连续值扩散过程建模每个标记的概率分布,消除了对向量量化的需求。通过训练一个以自回归预测向量为条件的小型去噪网络,该方法在 ImageNet 256×256 上实现了 SOTA 的 FID 得分(1.55),且每张图像的推理速度低于 0.3 秒,证明了自回归模型可在无需离散标记化的连续空间中被有效应用。
Conventional wisdom holds that autoregressive models for image generation are typically accompanied by vector-quantized tokens. We observe that while a discrete-valued space can facilitate representing a categorical distribution, it is not a necessity for autoregressive modeling. In this work, we propose to model the per-token probability distribution using a diffusion procedure, which allows us to apply autoregressive models in a continuous-valued space. Rather than using categorical cross-entropy loss, we define a Diffusion Loss function to model the per-token probability. This approach eliminates the need for discrete-valued tokenizers. We evaluate its effectiveness across a wide range of cases, including standard autoregressive models and generalized masked autoregressive (MAR) variants. By removing vector quantization, our image generator achieves strong results while enjoying the speed advantage of sequence modeling. We hope this work will motivate the use of autoregressive generation in other continuous-valued domains and applications. Code is available at: https://github.com/LTH14/mar.
研究动机与目标
- 挑战自回归模型在图像生成中必须依赖离散化、向量量化的表示这一传统观念。
- 开发一种连续值替代方案以取代向量量化,同时保留自回归建模的优势。
- 在兼容连续值标记的广义框架下,统一标准自回归模型与掩码自回归模型。
- 通过用基于扩散的概率建模方法替代分类交叉熵,提升图像生成的质量与速度。
- 在多种架构与标记化策略下,验证所提方法的有效性。
提出的方法
- 该方法用扩散损失替代传统的分类交叉熵损失,通过去噪扩散过程建模每个标记的概率分布。
- 对于每个自回归预测的标记向量 z,训练一个小型去噪网络(如 MLP)以建模实际图像标记 x 的条件分布 p(x|z)。
- 去噪网络与自回归模型通过反向传播联合训练,实现对连续值标记预测的端到端优化。
- 该方法兼容标准自回归(AR)与掩码自回归(MAR)模型,支持灵活的生成顺序与每步多标记预测。
- 该方法支持基于像素与连续值的标记化方式,且可与或不与分类器自由引导(CFG)结合使用。
- 推理过程通过在预测 z 向量条件下采样反向扩散过程实现,从而生成高保真图像。
实验结果
研究问题
- RQ1能否通过扩散过程建模每个标记的分布,实现在无需向量量化情况下的自回归图像生成?
- RQ2在连续值空间中,用基于扩散的损失替代分类交叉熵是否能提升图像生成的质量与速度?
- RQ3所提出的扩散损失是否可泛化至不同自回归架构,包括掩码自回归变体?
- RQ4在 FID、IS 与推理速度方面,该方法与 SOTA 模型相比表现如何?
- RQ5架构选择(如随机顺序掩码与双向注意力)对连续值自回归生成的质量与效率有何影响?
主要发现
- 所提扩散损失在 ImageNet 256×256 上实现了 1.55 的 Fréchet Inception Distance(FID),优于以往基于标记的方法,并接近领先潜扩散模型的性能。
- 该方法使用掩码自回归模型结合扩散损失,实现每张图像推理时间低于 0.3 秒,展现出极高的推理速度。
- MAR 变体在使用扩散损失时,FID 达到 2.31(无 CFG)与 1.78(有 CFG),显著优于此前的 MaskGIT 与 MAGE 等系统。
- 在 MAR 框架中,将因果注意力替换为双向注意力,FID 从 13.07 显著降低至 3.43(无 CFG),凸显上下文建模的重要性。
- 该方法表现出强劲的可扩展性,随着模型规模增大,性能持续提升,表明在更大架构下仍有进一步优化潜力。
- 该方法消除了对复杂、梯度近似敏感的向量量化标记器的需求,简化了训练流程并提升了重建质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。