[论文解读] Training Deep Energy-Based Models with f-Divergence Minimization
本文提出 f-EBM,一种变分框架,可使用任意 f-差异(而不仅 KL 差异)训练深度能量模型。通过建立具有理论收敛保证的单步极小化-极大化优化,f-EBM 在图像生成与去噪任务中相较于对比发散(contrastive divergence)展现出更优的生成质量和鲁棒性,尤其在 Jensen-Shannon 和平方 Hellinger 差异等情形下表现更佳。
Deep energy-based models (EBMs) are very flexible in distribution parametrization but computationally challenging because of the intractable partition function. They are typically trained via maximum likelihood, using contrastive divergence to approximate the gradient of the KL divergence between data and model distribution. While KL divergence has many desirable properties, other f-divergences have shown advantages in training implicit density generative models such as generative adversarial networks. In this paper, we propose a general variational framework termed f-EBM to train EBMs using any desired f-divergence. We introduce a corresponding optimization algorithm and prove its local convergence property with non-linear dynamical systems theory. Experimental results demonstrate the superiority of f-EBM over contrastive divergence, as well as the benefits of training EBMs using f-divergences other than KL.
研究动机与目标
- 为解决仅通过 KL 差异训练深度能量模型(EBM)所导致的灵活性受限问题,该问题限制了模式覆盖能力和生成质量。
- 开发一种可泛化的变分框架,支持使用任意 f-差异训练 EBM,从而实现多样化的训练目标。
- 基于非线性动力系统理论,为所提出的优化算法提供理论收敛保证。
- 在图像生成与重建任务中,展示替代性 f-差异(如 Jensen-Shannon、平方 Hellinger 和反向 KL)相较于传统对比发散的实用优势。
提出的方法
- 提出 f-EBM,一种变分框架,将数据分布与模型分布之间的 f-差异最小化问题建模为极小化-极大化优化问题。
- 引入一个包含能量函数与变分函数的双重目标,通过单步梯度更新近似 f-差异。
- 采用单步极小化-极大化优化策略,联合更新能量函数与变分函数,避免训练过程中迭代的 MCMC 采样。
- 在推理与训练期间使用 Langevin 动力学进行采样,并引入重放缓冲区以稳定生成过程。
- 应用谱归一化与 L2 正则化以提升训练稳定性与泛化能力。
- 基于非线性动力系统理论,理论证明了优化轨迹的局部收敛性,确立了优化过程的稳定性。
实验结果
研究问题
- RQ1除了 KL 差异外,其他 f-差异是否可有效用于训练非归一化能量模型?
- RQ2所提出的 f-EBM 框架是否在生成质量与分布覆盖方面优于对比发散?
- RQ3f-EBM 学习到的密度比是否能提升图像修复与去噪等下游任务的性能?
- RQ4f-EBM 优化算法的理论收敛行为如何?
- RQ5在模型误设情形下,不同 f-差异(如 Jensen-Shannon、平方 Hellinger)对图像生成性能有何影响?
主要发现
- 在 CIFAR-10 与 CelebA 数据集上,f-EBM 在生成质量方面优于对比发散,视觉样本显示出更高的清晰度与多样性。
- 使用 Jensen-Shannon 与平方 Hellinger 差异训练时,在图像修复与去噪任务中显著优于反向 KL 与基于 KL 的基线模型。
- f-EBM 学习到的密度比可实现有效的拒绝采样,即使在模型误设情况下也能恢复真实数据分布——这是对比发散无法实现的。
- f-EBM 在 50K–80K 次迭代内收敛,与对比发散(75K 次)相当,且每次迭代的时间复杂度相近(相差不超过 2 倍)。
- 中间 Langevin 动力学采样结果表明,f-EBM 生成轨迹更平滑、更连贯,尤其在平方 Hellinger 与 Jensen-Shannon 差异下表现更优。
- 最近邻分析表明,f-EBM 生成的图像比基于 KL 的模型更接近真实训练图像,表明其具有更优的分布对齐能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。