Skip to main content
QUICK REVIEW

[论文解读] Adaptive Density Estimation for Generative Models

Thomas W. Lucas, Konstantin Shmelkov|arXiv (Cornell University)|Jan 4, 2019
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

本文提出自适应变分密度估计(AV-ADE),一种混合生成模型,利用可逆神经网络将图像映射到潜在特征空间,通过对抗训练实现高保真度样本生成,通过最大似然法实现精确的似然估计。该方法在保持高似然性的同时,实现了与纯对抗模型相当的SOTA FID和IS得分,有效解决了样本质量与分布覆盖之间的权衡问题。

ABSTRACT

Unsupervised learning of generative models has seen tremendous progress over recent years, in particular due to generative adversarial networks (GANs), variational autoencoders, and flow-based models. GANs have dramatically improved sample quality, but suffer from two drawbacks: (i) they mode-drop, i.e., do not cover the full support of the train data, and (ii) they do not allow for likelihood evaluations on held-out data. In contrast, likelihood-based training encourages models to cover the full support of the train data, but yields poorer samples. These mutual shortcomings can in principle be addressed by training generative latent variable models in a hybrid adversarial-likelihood manner. However, we show that commonly made parametric assumptions create a conflict between them, making successful hybrid models non trivial. As a solution, we propose to use deep invertible transformations in the latent variable decoder. This approach allows for likelihood computations in image space, is more efficient than fully invertible models, and can take full advantage of adversarial training. We show that our model significantly improves over existing hybrid models: offering GAN-like samples, IS and FID scores that are competitive with fully adversarial models, and improved likelihood scores.

研究动机与目标

  • 解决生成模型中样本质量与分布覆盖之间的根本性权衡问题。
  • 克服GAN的局限性,如模式崩溃和缺乏似然评估,同时避免似然模型导致的样本质量低下问题。
  • 设计一种混合模型,实现在图像数据上的高质量样本生成与精确似然计算。
  • 通过放松VAE式解码器中的常见参数假设,缓解对抗目标与似然目标之间的冲突。
  • 证明潜在空间中的可逆、非线性映射可实现自适应密度估计,同时支持高效采样与完整支持覆盖。

提出的方法

  • 该模型使用可学习的、非线性的可逆变换 $ f_{\psi} $,将图像 $ x $ 映射到潜在特征空间,从而实现在图像空间中的精确似然计算。
  • 解码器在潜在空间中通过变分推断学习条件密度 $ p_{\theta}(x|z) $,其中 $ z = f_{\psi}(x) $,无需高斯分布或独立性假设即可实现完整的协方差结构。
  • 模型通过联合训练方式优化:在潜在空间中采用最大似然法以确保完整支持覆盖,在图像空间中采用对抗训练以提升样本质量。
  • 可逆映射 $ f_{\psi} $ 与生成模型端到端联合训练,支持高效前向传播采样与精确似然评估。
  • 该架构采用宽广的生成器和 $ f_{\psi} $ 中的残差块,无需归一化流或自回归建模。
  • 该方法避免了因子化或高斯条件密度等强假设,支持与数据分布复杂度相匹配的自适应密度估计。

实验结果

研究问题

  • RQ1混合生成模型是否能在不牺牲分布覆盖的前提下,同时实现高保真度样本与精确似然评估?
  • RQ2放松对 $ p(x|z) $ 的参数假设(如独立性或高斯性)是否能促进对抗目标与似然目标之间的更好对齐?
  • RQ3潜在空间中的可逆变换是否能实现高效、高质量的采样,同时支持精确的似然计算?
  • RQ4所提方法在标准基准测试中是否在样本质量(IS/FID)和似然性(BPD)方面均优于现有混合模型?
  • RQ5该模型是否能在CIFAR-10、STL-10、ImageNet和LSUN等多样化数据集上泛化,而无需大量超参数调优?

主要发现

  • 在CIFAR-10上,AV-ADE的Inception Score为8.2,FID为17.2,与WGAN-GP和SNGAN等纯对抗模型相比达到或超越其性能。
  • 在CIFAR-10上,该模型实现了3.7 BPD的似然性,与SOTA似然模型如Real-NVP(3.5 BPD)和Glow(3.4 BPD)相当。
  • 在STL-10上,AV-ADE的IS为9.4,FID为44.3,优于SNGAN(IS: 9.1,FID: 40.1),且保持了较强的似然性(BPD: 4.0–4.4)。
  • 在ImageNet上,AV-ADE的IS为8.5,FID为45.5,其似然性优于MMD-GAN,尽管MMD-GAN为纯对抗模型且无法进行似然评估,但FID表现相当。
  • 在LSUN教堂数据集上,AV-ADE生成的样本比Glow和Real-NVP更具说服力,FID为13.1,BPD为4.3,尽管其网络层数更少(7层 vs. 500+层)。
  • 消融研究证实,可逆映射 $ f_{\psi} $ 至关重要:移除后,似然性和样本质量均显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。