[论文解读] Generalized Energy Based Models
本文提出了广义能量模型(GEBMs),通过将隐式基分布(如生成器)与可学习的能量函数相结合,以在数据支撑流形上精细化概率质量。通过交替训练能量函数(使用一种称为KALE的广义似然损失)和基分布,GEBMs在模型复杂度相当的情况下,生成的样本质量优于GAN,尤其在数据位于低维流形时表现更优。
We introduce the Generalized Energy Based Model (GEBM) for generative modelling. These models combine two trained components: a base distribution (generally an implicit model), which can learn the support of data with low intrinsic dimension in a high dimensional space; and an energy function, to refine the probability mass on the learned support. Both the energy function and base jointly constitute the final model, unlike GANs, which retain only the base distribution (the "generator"). GEBMs are trained by alternating between learning the energy and the base. We show that both training stages are well-defined: the energy is learned by maximising a generalized likelihood, and the resulting energy-based loss provides informative gradients for learning the base. Samples from the posterior on the latent space of the trained model can be obtained via MCMC, thus finding regions in this space that produce better quality samples. Empirically, the GEBM samples on image-generation tasks are of much better quality than those from the learned generator alone, indicating that all else being equal, the GEBM will outperform a GAN of the same complexity. When using normalizing flows as base measures, GEBMs succeed on density modelling tasks, returning comparable performance to direct maximum likelihood of the same networks.
研究动机与目标
- 解决GAN在学习数据支撑后,仍难以在低维数据流形上精细化概率质量的局限性。
- 通过引入一种可计算的、近似化的似然估计方法,克服能量模型中归一化常数不可计算的问题。
- 通过将能量函数融入基生成器潜在空间的后验推断,实现更优的采样质量。
- 证明即使GAN使用更复杂的生成器,GEBMs在低维数据设置下仍优于标准GAN。
提出的方法
- 提出两组件模型:一个隐式基分布(如生成器),用于学习数据支撑;以及一个能量函数,用于在该支撑上精细化概率质量。
- 通过最大化基于KALE(KL近似下界估计)损失的广义似然,训练能量函数,该损失源自Donsker-Varadhan和Fenchel对偶理论。
- 将KALE损失用作基生成器的训练信号,确保梯度定义明确,并在适当条件下提供弱收敛保证。
- 执行交替优化:固定步数更新能量函数,随后使用当前能量函数更新基生成器。
- 通过在基生成器的潜在空间中执行MCMC采样,从GEBM中生成样本,利用学习到的能量函数引导后验分布朝向高质量样本。
- 利用基于Eberle等人(2017)的基于梯度的MCMC采样器,实现在潜在空间中的快速收敛。
实验结果
研究问题
- RQ1结合隐式基分布与可学习能量函数的模型,是否能在保持相同模型复杂度的前提下,优于标准GAN的样本质量?
- RQ2KALE损失是否能为联合训练系统中的能量和基组件提供稳定且信息丰富的训练信号?
- RQ3能量函数如何通过引导基生成器潜在空间的后验分布,提升采样质量?
- RQ4基生成器的模型复杂度在多大程度上影响GAN与GEBMs之间的性能差距?
- RQ5当基模型为归一化流时,GEBMs是否能实现与直接最大似然训练相当的密度估计性能?
主要发现
- GEBMs在相同复杂度下始终生成比GAN更高质量的样本,即使GAN使用更复杂的生成器。
- 随着GAN生成器表达能力增强,GAN与GEBMs之间的性能差距缩小,表明能量函数捕捉了残余分布差异。
- 使用更简单基生成器的GEBMs优于使用更复杂生成器的GAN,表明能量函数提供了更有效的精细化机制。
- 当基模型为归一化流时,GEBMs实现的密度估计性能与在相同网络上直接进行最大似然训练相当。
- KALE损失为基生成器提供了明确定义的梯度,并在适当条件下确保弱收敛。
- 在潜在空间中,由学习到的能量引导的MCMC采样成功识别出能生成高质量样本的区域,从而提升生成质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。