Skip to main content
QUICK REVIEW

[论文解读] Super-resolution Variational Auto-Encoders

Ioannis Gatopoulos, Maarten Stol|arXiv (Cornell University)|Jun 9, 2020
Advanced Image Processing Techniques参考文献 31被引用 7
一句话总结

该论文提出超分辨率变分自编码器(srVAE),通过引入下采样图像作为潜在变量,增强VAE模型,实现在保留对数似然目标的同时实现高保真图像生成。该模型在CIFAR-10和ImageNet32上取得了SOTA的FID分数,显著提升了图像清晰度,同时未牺牲似然性能。

ABSTRACT

The framework of variational autoencoders (VAEs) provides a principled method for jointly learning latent-variable models and corresponding inference models. However, the main drawback of this approach is the blurriness of the generated images. Some studies link this effect to the objective function, namely, the (negative) log-likelihood. Here, we propose to enhance VAEs by adding a random variable that is a downscaled version of the original image and still use the log-likelihood function as the learning objective. Further, by providing the downscaled image as an input to the decoder, it can be used in a manner similar to the super-resolution. We present empirically that the proposed approach performs comparably to VAEs in terms of the negative log-likelihood, but it obtains a better FID score in data synthesis.

研究动机与目标

  • 为解决VAE生成图像模糊的问题,该问题通常与对数似然目标相关。
  • 在不放弃对数似然训练目标的前提下,提升VAE的图像质量。
  • 通过结构化且可学习的下采样表示,将超分辨率整合到VAE框架中。
  • 证明更具层次结构的潜在变量(包含超分辨率组件)可提升生成图像的保真度,同时保持具有竞争力的似然分数。

提出的方法

  • 引入一个新的潜在变量,表示输入图像的2倍下采样版本,记为y,作为解码器的输入。
  • 使用标准VAE目标(ELBO),通过联合似然函数建模原始图像x与下采样图像y,二者均以潜在变量为条件。
  • 采用基于DenseNet的编码器和解码器,并使用基于RealNVP的流先验,以建模复杂且数据驱动的潜在变量先验分布。
  • 通过向解码器输入下采样图像y实现条件生成,从而实现类似超分辨率的图像重建。
  • 使用重参数化梯度与蒙特卡洛估计优化ELBO目标,保持端到端可微性。
  • 在训练过程中将下采样图像作为监督信号,使模型能够学习从粗到细的层次化图像生成过程。

实验结果

研究问题

  • RQ1引入下采样图像作为潜在变量是否能在不损害对数似然目标的前提下,提升VAE生成图像的清晰度?
  • RQ2在VAE框架中引入超分辨率组件是否能通过FID指标衡量,带来更好的感知质量?
  • RQ3与标准VAE相比,该模型在似然性和重建保真度方面表现如何?
  • RQ4基于流的先验与多层次潜在结构是否能缓解VAE中的后验坍缩问题?
  • RQ5分层生成过程(从粗到细)在多大程度上模拟了人类视觉系统在图像感知中的发展过程?

主要发现

  • srVAE在Fréchet Inception Distance(FID)分数上显著优于标准VAE,表明其具有更高的感知质量与更清晰的图像生成能力。
  • 在CIFAR-10上,该模型的bits per dimension(bpd)分数与当前最先进的单层次VAE相当,证明其具有强大的密度估计性能。
  • 与标准VAE相比,该模型在原始图像(RE_x)上的重建误差更低,表明其在重建保真度方面有所提升。
  • 尽管下采样图像(RE_y)的重建误差更高,但整体FID分数的提升证实了分层生成过程的有效性。
  • 潜在变量z和u的KL散度值均保持较高水平(在CIFAR-10和ImageNet32上均约为1500),表明未发生后验坍缩,潜在空间被充分使用。
  • 定性结果表明,该模型生成的图像具有连贯的全局结构与清晰的局部细节,类似于先绘制草图再逐步细化的两阶段过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。