[论文解读] Variational f-divergence Minimization
本文提出了一种变分上界,用于在最大似然之外训练隐变量模型时优化f-散度,通过扩展辅助变分方法,使反向KL等多样化f-散度的优化成为可能。该方法允许产生定性不同的模型行为(如图像生成中的模式搜寻),同时仅需对标准VAE训练过程进行最小修改。
Probabilistic models are often trained by maximum likelihood, which corresponds to minimizing a specific f-divergence between the model and data distribution. In light of recent successes in training Generative Adversarial Networks, alternative non-likelihood training criteria have been proposed. Whilst not necessarily statistically efficient, these alternatives may better match user requirements such as sharp image generation. A general variational method for training probabilistic latent variable models using maximum likelihood is well established; however, how to train latent variable models using other f-divergences is comparatively unknown. We discuss a variational approach that, when combined with the recently introduced Spread Divergence, can be applied to train a large class of latent variable models using any f-divergence.
研究动机与目标
- 将变分推断从最大似然(前向KL)扩展到更广泛的f-散度类别,以适用于隐变量模型。
- 解决在复杂模型中缺乏针对非似然f-散度的一般性变分训练方法的问题。
- 使能够使用如反向KL等散度进行训练,这些散度更注重高保真度样本生成而非模式覆盖。
- 通过联合变分推断,在边缘数据空间中提供f-散度的可微分、可计算的上界。
- 证明不同f-散度会导致定性不同的模型行为,尤其在高维生成任务中。
提出的方法
- 通过在联合空间 (x,z) 上引入辅助变分分布,提出f-散度 D_f(p||q) 的变分上界。
- 利用f的Fenchel共轭推导出f-散度的联合上界,从而实现可计算的优化。
- 应用辅助变分方法(Agakov & Barber, 2004)构建依赖于联合分布 p(x,z) 和 q(z|x) 的上界。
- 使用重参数化技巧,实现对模型参数 θ 和推理网络参数 φ 的基于梯度的优化。
- 利用最近提出的Spread Divergence来稳定变分上界,提升训练稳定性。
- 通过随机梯度下降优化上界,且在变分近似最优的极限下,该上界收敛至真实的f-散度。
实验结果
研究问题
- RQ1f-散度最小化能否被推广至隐变量模型,超越最大似然?
- RQ2如何构建f-散度的变分上界,以实现非似然目标的端到端训练?
- RQ3在使用前向KL与反向KL或其他f-散度进行训练时,模型行为的定性差异是什么?
- RQ4所提出的方法是否能有效实现以保真度优先而非覆盖度优先的散度进行生成模型训练?
- RQ5在图像合成等高维生成任务中,f-散度的选择如何影响模型性能?
主要发现
- 所提出的f-散度变分上界使隐变量模型能够使用任意f-散度进行训练,而不仅限于前向KL。
- 使用反向KL进行训练会引发模式搜寻行为,使生成聚焦于少数主导模式的高保真样本,与前向KL的模式覆盖行为形成鲜明对比。
- 在图像生成任务中,反向KL训练产生的样本比使用前向KL训练的标准VAE更清晰、保真度更高。
- 该方法仅需对标准VAE训练流程进行微小修改,具有实际应用价值且易于实现。
- f-散度的上界是可微分的,且可通过重参数化技巧实现随机优化。
- 在低维玩具问题上的实证结果表明,不同f-散度会产生不同的模型拟合结果,验证了该方法的理论灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。