Skip to main content
QUICK REVIEW

[论文解读] Constraining Variational Inference with Geometric Jensen-Shannon Divergence

J. Deasy, Nikola Simidjievski|arXiv (Cornell University)|Jun 18, 2020
Generative Adversarial Networks and Image Synthesis被引用 10
一句话总结

本文提出了一种新颖的变分自编码器(VAEs)正则化方法,采用偏斜几何Jensen-Shannon散度(JS^G_α),实现了前向KL散度与反向KL散度之间的直观插值。通过重新参数化中间分布,该方法提供了闭式、可解释的损失函数,仅需一个超参数α,即可在基准数据集上显著提升重建与生成性能。

ABSTRACT

We examine the problem of controlling divergences for latent space regularisation in variational autoencoders. Specifically, when aiming to reconstruct example $x\\in\\mathbb{R}^{m}$ via latent space $z\\in\\mathbb{R}^{n}$ ($n\\leq m$), while balancing this against the need for generalisable latent representations. We present a regularisation mechanism based on the skew-geometric Jensen-Shannon divergence $\\left(\ extrm{JS}^{\ extrm{G}_{\\alpha}}\ ight)$. We find a variation in $\ extrm{JS}^{\ extrm{G}_{\\alpha}}$, motivated by limiting cases, which leads to an intuitive interpolation between forward and reverse KL in the space of both distributions and divergences. We motivate its potential benefits for VAEs through low-dimensional examples, before presenting quantitative and qualitative results. Our experiments demonstrate that skewing our variant of $\ extrm{JS}^{\ extrm{G}_{\\alpha}}$, in the context of $\ extrm{JS}^{\ extrm{G}_{\\alpha}}$-VAEs, leads to better reconstruction and generation when compared to several baseline VAEs. Our approach is entirely unsupervised and utilises only one hyperparameter which can be easily interpreted in latent space.

研究动机与目标

  • 为解决VAE中正则化强度缺乏直观控制的问题,特别是KL散度项的不透明缩放问题。
  • 克服多变量高斯设定下前向KL与反向KL散度之间缺乏可处理插值的问题。
  • 开发一种在分布空间与散度空间中均保持可解释性的正则化机制,同时提升VAE性能。
  • 证明通过偏斜几何JS散度可实现优于标准VAE基线的重建与生成性能。

提出的方法

  • 通过重新参数化中间分布,提出一种改进的偏斜几何Jensen-Shannon散度(JS^G_α),以实现前向KL与反向KL散度之间的平滑插值。
  • 通过将散度表示为多变量高斯分布的均值与协方差参数形式,推导出JS^G_α-VAE的闭式损失函数。
  • 引入对偶形式JS^G_α_*,以进一步提升性能,尤其在重尾后验分布设定下表现更优。
  • 采用单一、可解释的超参数α,用于控制零避免(前向KL)与零强制(反向KL)行为之间的平衡。
  • 以无监督方式应用该方法,无需额外的超参数调优或事后分析。
  • 通过低维可视化与标准图像基准数据集上的定量评估验证该方法的有效性。

实验结果

研究问题

  • RQ1在多变量高斯VAE中,能否实现前向KL与反向KL散度之间的可处理插值?
  • RQ2与标准KL或JS散度相比,偏斜几何JS散度是否提供了更直观且更有效的正则化机制?
  • RQ3JS^G_α-VAE是否能在多种数据集上实现优于基线VAE的重建与生成性能?
  • RQ4偏斜参数α的选择如何影响潜在表征中模式覆盖与清晰度之间的权衡?
  • RQ5对偶形式JS^G_α_*是否在VAE训练中优于标准JS^G_α?

主要发现

  • 对偶形式JS^G_α_*在多个基准数据集上,于测试集重建损失方面始终优于前向KL与反向KL散度。
  • JS^G_α-VAE在定性与定量重建性能上均显著优于标准VAE、β-VAE与InfoGAN基线模型。
  • 该方法通过单一超参数α实现了前向KL与反向KL行为之间的平滑、可解释的插值,该参数可直接控制模式覆盖与清晰度之间的平衡。
  • 偏斜几何JS散度在处理轻尾后验分布时,相较于标准JS散度更具有效性,尤其适用于VAE训练。
  • 所提出的正则化机制完全为无监督方法,除α外无需额外超参数调优,且α在潜在空间中具有明确的几何解释。
  • 实证结果表明,最优性能出现在α值的特定范围内,提示可为VAE建立标准化的正则化策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。