Skip to main content
QUICK REVIEW

[论文解读] DiVAE: Photorealistic Images Synthesis with Denoising Diffusion Decoder

Jie Shi, Chenfei Wu|arXiv (Cornell University)|Jun 1, 2022
Generative Adversarial Networks and Image Synthesis被引用 11
一句话总结

DiVAE 提出了一种基于 VQ-VAE 框架的生成方法,采用去噪扩散解码器,通过条件化离散图像嵌入来生成逼真的图像。该方法在文本到图像生成任务中实现了最先进(SOTA)的 FID 分数(11.53),并在重建细微细节方面优于先前方法,尤其当使用自回归模型生成的嵌入时表现更优。

ABSTRACT

Recently most successful image synthesis models are multi stage process to combine the advantages of different methods, which always includes a VAE-like model for faithfully reconstructing embedding to image and a prior model to generate image embedding. At the same time, diffusion models have shown be capacity to generate high-quality synthetic images. Our work proposes a VQ-VAE architecture model with a diffusion decoder (DiVAE) to work as the reconstructing component in image synthesis. We explore how to input image embedding into diffusion model for excellent performance and find that simple modification on diffusion's UNet can achieve it. Training on ImageNet, Our model achieves state-of-the-art results and generates more photorealistic images specifically. In addition, we apply the DiVAE with an Auto-regressive generator on conditional synthesis tasks to perform more human-feeling and detailed samples.

研究动机与目标

  • 通过用基于扩散的解码器替代传统 VAE 解码器,提升多阶段生成模型中图像嵌入的重建质量。
  • 研究如何有效将扩散模型条件化于离散图像嵌入,以实现高保真度图像生成。
  • 在保持逼真感和细微细节的前提下,实现图像重建与文本到图像生成的最先进性能。
  • 探索对扩散模型中 UNet 的架构修改,以实现在网络不同深度有效集成图像嵌入。

提出的方法

  • 提出 DiVAE,一种 VQ-VAE 架构,其解码器为一个去噪扩散模型,训练目标是根据离散潜在码重建图像。
  • 通过在特定层(特别是瓶颈块)通过拼接或相加的方式注入图像嵌入,对标准 UNet 架构进行修改,以实现最优性能。
  • 采用去噪扩散过程,通过逆转前向加噪过程,从潜在码生成高质量图像。
  • 在 UNet 中采用基于残差连接的跳跃连接结构,以在去噪过程中保留空间信息。
  • 在推理阶段应用无分类器指导(classifier-free guidance),以提升条件生成任务中的样本质量。
  • 在 ImageNet 256×256 上进行训练,并通过自回归先验进行微调,以支持文本到图像生成。

实验结果

研究问题

  • RQ1能否在 VQ-VAE 框架中有效使用扩散模型作为解码器,从离散潜在码生成逼真图像?
  • RQ2在 UNet 架构中,何处是注入图像嵌入以实现最佳重建保真度的最有效位置?
  • RQ3不同注入机制(拼接、相加或注意力机制)对生成图像质量有何影响?
  • RQ4与标准 VAE 或自回归解码器相比,使用扩散解码器是否能提升多阶段生成中的图像细节与真实感?
  • RQ5当结合自回归先验时,DiVAE 是否能在文本到图像生成中实现最先进性能?

主要发现

  • DiVAE 在 MSCOCO 256×256 文本到图像基准测试中实现了 11.53 的 Fréchet Inception Distance(FID)分数,优于先前模型(包括 DALL-E2 的零样本 FID 10.39 和 VQ-Diffusion 的 13.86)。
  • 与基线方法相比,该模型生成的图像更具逼真感和细节,尤其在重建眼睛、头发等细微结构方面表现更优。
  • 将图像嵌入注入 UNet 的中间(瓶颈)块时,FID 分数最佳(11.58),显著优于在编码器或解码器块注入的方式。
  • 在中间块使用拼接或相加方式注入嵌入,性能相当(FID 分别为 11.58 和 11.61),表明两者均有效;而基于注意力的注入方式表现较差(FID 13.35)。
  • 与使用相同潜在码的 NUWA 相比,DiVAE 生成的图像更具真实感和细节,尤其在高频纹理和面部特征方面表现更优。
  • 由于其强大的重建能力,该模型在多阶段生成中支持更高的压缩率,有助于更高效的预训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。