Skip to main content
QUICK REVIEW

[论文解读] Exponential Tilting of Generative Models: Improving Sample Quality by Training and Sampling from Latent Energy

Zhisheng Xiao, Qing Yan|arXiv (Cornell University)|Jun 15, 2020
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 4
一句话总结

本文提出一种方法,通过在预训练生成模型的潜在空间上训练一个潜在能量模型(EBM),来提升基于似然的生成模型(如归一化流和VAE)的样本质量。该EBM通过最大似然训练以优化潜在变量,随后通过Langevin动力学采样,并解码生成更高清、更高质量的图像,且计算开销极低。

ABSTRACT

In this paper, we present a general method that can improve the sample quality of pre-trained likelihood based generative models. Our method constructs an energy function on the latent variable space that yields an energy function on samples produced by the pre-trained generative model. The energy based model is efficiently trained by maximizing the data likelihood, and after training, new samples in the latent space are generated from the energy based model and passed through the generator to producing samples in observation space. We show that using our proposed method, we can greatly improve the sample quality of popular likelihood based generative models, such as normalizing flows and VAEs, with very little computational overhead.

研究动机与目标

  • 在不重新训练基础模型的前提下,提升预训练基于似然的生成模型的样本质量。
  • 解决非对抗性模型(如VAE和归一化流)生成的样本质量通常低于GAN的问题。
  • 开发一种通过改进采样而非修改训练目标来提升样本质量的方法。
  • 实现高效训练和采样潜在EBM,同时利用预训练生成器的结构。
  • 提供一个通用框架,将能量模型与现有的基于似然的生成模型相连接。

提出的方法

  • 通过定义新的联合分布构建预训练生成模型的指数倾斜:$ p_{\phi^{*},\theta}(\mathbf{x}) = \frac{p_{\phi^{*}}(\mathbf{x}) \exp(-E_{\theta}(\mathbf{x}))}{Z_{\phi^{*},\theta}} $,其中 $ E_{\theta}(\mathbf{x}) $ 是数据空间上的能量函数。
  • 通过最大化真实数据的似然来训练能量函数 $ E_{\theta}(\mathbf{x}) $,使用梯度:$ \frac{\partial L(\theta)}{\partial\theta} = \mathbb{E}_{p_D}[\partial E_\theta / \partial\theta] - \mathbb{E}_{p_{\phi^{*},\theta}}[\partial E_\theta / \partial\theta] $。
  • 使用随机梯度Langevin动力学(SGLD)从潜在EBM中采样,通过迭代更新潜在变量:$ \mathbf{z}_{i+1} = \mathbf{z}_i - \frac{\epsilon}{2} \nabla_{\mathbf{z}} E_\theta(G_{\phi^*}(\mathbf{z})) + \sqrt{\epsilon} \mathbf{\omega} $,其中 $ \mathbf{\omega} \sim \mathcal{N}(0,\mathbf{I}) $。
  • 通过预训练生成器 $ G_{\phi^*}(\mathbf{z}) $ 解码优化后的潜在变量,生成更真实、更清晰的最终样本。
  • 潜在EBM的训练仅需100–200步(归一化流)至1,000步(VAE),计算开销极低。
  • 对 $ E_{\theta}(\mathbf{x}) $ 使用相同的网络架构(如CNN),并使用真实数据和生成样本端到端联合训练。

实验结果

研究问题

  • RQ1我们能否在不重新训练基础模型的前提下,提升预训练基于似然的生成模型的样本质量?
  • RQ2在预训练生成器的潜在空间上训练能量模型,是否能生成更清晰、更真实的样本?
  • RQ3与修改训练目标或使用GAN风格判别器指导的现有技术相比,该方法表现如何?
  • RQ4训练潜在EBM的计算成本是多少?是否能在显著提升样本质量的同时保持极低的计算开销?
  • RQ5该方法能否泛化到不同类型的基于似然的模型,如VAE、归一化流及其混合模型?

主要发现

  • 在MNIST、Fashion-MNIST和CIFAR-10数据集上,该方法显著提升了样本质量,例如在使用GLOW模型时,MNIST的FID分数从29.4降至12.3。
  • 在CIFAR-10上,GLOW的FID分数在应用潜在EBM后从76.2降至67.8,表明噪声减少且结构保真度提升。
  • 对于VAE,FID分数从18.9降至16.0,且未修改原始VAE训练目标,即实现了样本质量的提升。
  • 与两阶段VAE或基于流的归一化流VAE相比,该方法在FID指标上表现更优,同时保持了结构化的潜在空间。
  • 潜在EBM的训练仅需100–200步(归一化流)至1,000步(VAE),相比在像素空间上完整训练EBM,计算开销极低。
  • 定性结果表明,潜在EBM采样生成的样本更清晰、语义更合理,轮廓更平滑,背景更干净,尤其在CIFAR-10等复杂数据集上表现显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。