Skip to main content
QUICK REVIEW

[论文解读] Deep Variational Inference Without Pixel-Wise Reconstruction

Siddharth Agrawal, Ambedkar Dukkipati|arXiv (Cornell University)|Nov 16, 2016
Generative Adversarial Networks and Image Synthesis参考文献 19被引用 7
一句话总结

本文提出 VAPNEV,一种变分自编码器,其用真实值非体积保持(real NVP)流取代了传统的像素级重建。通过利用基于 VAE 潜在空间条件化的耦合层,该模型在图像生成任务中实现了具有竞争力的性能——与卷积 DRAW 和 real NVP 等复杂模型相当或更优,同时实现了高效采样和精确似然计算,且无模糊问题。

ABSTRACT

Variational autoencoders (VAEs), that are built upon deep neural networks have emerged as popular generative models in computer vision. Most of the work towards improving variational autoencoders has focused mainly on making the approximations to the posterior flexible and accurate, leading to tremendous progress. However, there have been limited efforts to replace pixel-wise reconstruction, which have known shortcomings. In this work, we use real-valued non-volume preserving transformations (real NVP) to exactly compute the conditional likelihood of the data given the latent distribution. We show that a simple VAE with this form of reconstruction is competitive with complicated VAE structures, on image modeling tasks. As part of our model, we develop powerful conditional coupling layers that enable real NVP to learn with fewer intermediate layers.

研究动机与目标

  • 为解决 VAE 中像素级重建的已知缺陷,如均方误差损失导致的生成图像模糊问题。
  • 通过可逆归一化流实现 VAE 中条件似然项的精确计算。
  • 通过将耦合层条件化于 VAE 的潜在表示,开发出更具表现力且高效的流架构。
  • 证明简单 VAE 通过精确似然建模可超越或匹配具有多个随机层和循环连接的复杂 VAE。
  • 提供一种支持高效训练、采样以及在半监督或条件学习中下游应用的生成模型。

提出的方法

  • 使用 real NVP 变换建模条件似然 $ p(x|z) $,通过变量变换公式实现精确似然计算。
  • 引入条件耦合层,将潜在码 $ z $ 与输入之间的乘法交互引入,以更少层数提升表达能力。
  • 采用多尺度架构,并在耦合层中使用棋盘式和通道式掩码,受 real NVP 启发,以提升流建模效果。
  • 在流网络 $ l_z(x) $ 和 $ m_z(x) $ 中应用挤压操作和残差块,且 $ l $ 与 $ m $ 之间共享架构以提升效率。
  • 通过最大化变分下界端到端训练模型,其中重建项通过流的雅可比行列式精确计算。
  • 通过水平翻转和多尺度流设计进行数据增强,以提升泛化能力和建模容量。

实验结果

研究问题

  • RQ1用归一化流实现像素级重建的精确似然建模,能否提升 VAE 在图像生成任务中的性能?
  • RQ2将流条件化于 VAE 的潜在码,对模型表达能力与样本质量有何影响?
  • RQ3具有紧凑流架构的简单 VAE 能否在性能上匹配或超越如卷积 DRAW 等复杂 VAE?
  • RQ4使用 VAE 提供全局语义表征,是否能提升归一化流的性能,相比标准 NVP?
  • RQ5所提方法能否在保持高效采样与训练的同时,实现具有竞争力的每维比特数(bits-per-dimension)得分?

主要发现

  • 在 CIFAR-10 上,VAPNEV 的每维比特数低于 3.55,优于卷积 DRAW,且与最先进模型相当。
  • 在 CelebA 上,VAPNEV 的每维比特数低于 2.8,尽管模型架构更小(仅两尺度),但显著优于 real NVP。
  • 与标准 VAE 相比,该模型生成的重建图像更清晰、语义更一致,能捕捉到物体姿态、背景颜色和面部表情等高层特征。
  • 条件耦合层设计使模型能以更少层数学习复杂变换,从而提升样本质量与似然估计性能。
  • 该模型支持精确似然计算与高效采样,不同于 GAN 增强的 VAE,可实现与其他 VAE 的客观比较。
  • 结果表明,利用 VAE 的潜在空间作为归一化流的全局上下文,能显著增强流建模能力,尤其在高维图像生成中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。