[论文解读] Learning Generative Models using Denoising Density Estimators
本文提出去噪密度估计器(DDEs),一种通过直接最小化真实数据密度与生成密度之间反向Kullback-Leibler散度来训练生成模型的新方法。该方法使用可微神经网络估计未归一化的密度,无需依赖归一化流的可逆结构或ODE求解器,在基准数据集上实现了最先进水平的对数似然性能,同时避免了模式崩溃问题。
Learning probabilistic models that can estimate the density of a given set of samples, and generate samples from that density, is one of the fundamental challenges in unsupervised machine learning. We introduce a new generative model based on denoising density estimators (DDEs), which are scalar functions parameterized by neural networks, that are efficiently trained to represent kernel density estimators of the data. Leveraging DDEs, our main contribution is a novel technique to obtain generative models by minimizing the KL-divergence directly. We prove that our algorithm for obtaining generative models is guaranteed to converge to the correct solution. Our approach does not require specific network architecture as in normalizing flows, nor use ordinary differential equation solvers as in continuous normalizing flows. Experimental results demonstrate substantial improvement in density estimation and competitive performance in generative model training.
研究动机与目标
- 开发一种新型生成建模框架,实现高效的密度估计与采样,而无需依赖可逆结构或ODE积分。
- 解决现有方法的局限性,如GAN中的模式崩溃问题以及归一化流的计算复杂性。
- 提供一个统一的训练目标,直接最小化生成分布与真实数据分布之间的统计差异。
- 证明DDE在多种数据集上均能在密度估计与样本生成方面实现具有竞争力的性能。
提出的方法
- 该方法利用去噪自编码器训练基于标量神经网络的密度估计器(DDEs),以近似数据分布的未归一化密度。
- 将生成器训练表述为最小化真实数据密度与生成密度之间的反向KL散度,确保收敛至正确解。
- 通过去噪目标训练DDEs,实现高效优化,无需高阶导数或近似。
- 使用具有学习得到的均值和方差的高斯提议分布,通过重要性采样估计归一化常数。
- 使用DDEs对真实数据和生成数据进行端到端训练,实现对能量基模型的直接优化。
- 该方法与架构无关,仅依赖可微性,避免了对可逆流或ODE求解器的需求。
实验结果
研究问题
- RQ1能否在不依赖可逆映射或ODE求解器的情况下,通过直接最小化真实与生成数据密度之间的反向KL散度来训练生成模型?
- RQ2与归一化流和自回归模型相比,使用去噪密度估计器在对数似然性能和样本质量方面表现如何?
- RQ3所提出的方法能否在高维数据(如图像生成任务)中避免模式崩溃?
- RQ4去噪目标中的噪声水平(ση)对模型性能和收敛性有何影响?
- RQ5DDE-based框架能否在极少架构约束下扩展至CIFAR-10或高分辨率图像等高维数据?
主要发现
- 所提方法在四个基准数据集上实现了最先进水平的对数似然性能:POWER(0.97 ± 0.18)、GAS(9.73 ± 1.14)、HEPMASS(-11.3 ± 0.16)和MINIBOON(-6.94 ± 1.81)。
- 模型对模式崩溃表现出强鲁棒性,在堆叠MNIST上的表现与最先进Wasserstein GAN相当。
- 该方法在无需归一化流的可逆耦合层或ODE积分的情况下实现了具有竞争力的性能,简化了训练与推理过程。
- 该方法在多种数据类型(包括高维表格数据与图像数据)中展现出强大的泛化能力。
- 每次运行使用51,200个样本的重要性采样,能稳定估计归一化常数,且在实验中方差较低。
- 理论分析证实,在反向KL散度目标下,训练算法可收敛至唯一的全局最优解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。