Skip to main content
QUICK REVIEW

[论文解读] On importance-weighted autoencoders

Axel Finke, Alexandre H. Thiéry|arXiv (Cornell University)|Jul 24, 2019
Generative Adversarial Networks and Image Synthesis参考文献 33被引用 5
一句话总结

本文提出了用于学习的自适应重要性采样(AISLE),这是一个统一框架,推广了重加权唤醒-睡眠(RWS)算法,并将IWAE-STL和IWAE-DREG梯度作为特例包含在内。结果表明,RWS型自适应重要性采样在高方差条件下比多样本IWAE目标更稳健,并为启发式IWAE变体提供了严谨的理论基础。

ABSTRACT

The importance weighted autoencoder (IWAE) (Burda et al., 2016) is a popular variational-inference method which achieves a tighter evidence bound (and hence a lower bias) than standard variational autoencoders by optimising a multi-sample objective, i.e. an objective that is expressible as an integral over $K > 1$ Monte Carlo samples. Unfortunately, IWAE crucially relies on the availability of reparametrisations and even if these exist, the multi-sample objective leads to inference-network gradients which break down as $K$ is increased (Rainforth et al., 2018). This breakdown can only be circumvented by removing high-variance score-function terms, either by heuristically ignoring them (which yields the 'sticking-the-landing' IWAE (IWAE-STL) gradient from Roeder et al. (2017)) or through an identity from Tucker et al. (2019) (which yields the 'doubly-reparametrised' IWAE (IWAE-DREG) gradient). In this work, we argue that directly optimising the proposal distribution in importance sampling as in the reweighted wake-sleep (RWS) algorithm from Bornschein & Bengio (2015) is preferable to optimising IWAE-type multi-sample objectives. To formalise this argument, we introduce an adaptive-importance sampling framework termed adaptive importance sampling for learning (AISLE) which slightly generalises the RWS algorithm. We then show that AISLE admits IWAE-STL and IWAE-DREG (i.e. the IWAE-gradients which avoid breakdown) as special cases.

研究动机与目标

  • 为解决重要加权自编码器(IWAE)中K增大时的梯度崩溃问题,特别是φ-梯度中信噪比下降的问题。
  • 主张自适应重要性采样(如重加权唤醒-睡眠,RWS算法)优于IWAE的多样本目标范式。
  • 形式化一个通用框架——用于学习的自适应重要性采样(AISLE),将RWS、IWAE-STL和IWAE-DREG统一于同一理论方法之下。
  • 为启发式IWAE-STL梯度提供理论依据,并表明其自然地源于RWS型自适应重要性采样视角。
  • 在不同设置下对AISLE变体进行实证评估,并与IWAE、IWAE-DREG和RWS-DREG进行比较,尤其关注非独立同分布和高维潜在空间的情形。

提出的方法

  • 提出AISLE,一种用于变分推断的通用自适应重要性采样框架,通过迭代优化提议分布qφ,x(z)同时学习模型参数θ。
  • 在AISLE中引入基于散度的两种目标:KL散度和χ²散度,分别导出AISLE-KL和AISLE-χ²变体。
  • 使用K个粒子的自归一化重要性采样推导AISLE的φ-梯度,避免重参数化与得分函数方差问题。
  • 证明IWAE-STL和IWAE-DREG梯度是AISLE的特例,其中IWAE-STL通过Tucker等人(2019)提出的双重重参数化恒等式的新应用获得。
  • 通过α*-缩放对重要性权重进行正则化,以缓解数值不稳定性,并降低高方差区域的偏差。
  • 实验中使用ADAM配合权重正则化以稳定训练,尤其在高K设置下表现更优。

实验结果

研究问题

  • RQ1与IWAE的多样本目标相比,RWS的自适应重要性采样方法在梯度稳定性和实证性能方面是否更优?
  • RQ2启发式IWAE-STL梯度能否在严谨的理论框架内得到合理解释?
  • RQ3IWAE-DREG和IWAE-STL梯度是否能自然地从类似AISLE的广义RWS型框架中导出?
  • RQ4AISLE在不同维度和粒子数下的性能与IWAE、IWAE-DREG和RWS-DREG相比如何?
  • RQ5重要性权重正则化在高方差场景中对稳定梯度和提升收敛性起到何种作用?

主要发现

  • AISLE-KL-NOREP和AISLE-χ²-NOREP(避免重参数化)在变分族不包含真实后验时表现优于‘得分函数自由’梯度(IWAE-STL、IWAE-DREG),尤其在中等K值下。
  • 标准IWAE φ-梯度性能随K增大而下降,与先前理论预测的O(K−1/2)信噪比衰减一致。
  • 出乎意料的是,‘得分函数自由’梯度(IWAE-STL、IWAE-DREG)并未随K增大而改善;事实上,由于主导的O(K−1)自归一化偏差,性能有时反而下降。
  • 对重要性权重的正则化显著提升了χ²型AISLE变体的稳定性与性能,尤其在高维设置下(D=10)。
  • RWS-DREG仅在提议分布qφ,x接近真实后验πθ,x时表现良好,在高维或表达能力不足的变分族中会失效。
  • IWAE-STL和IWAE-DREG中的O(K−1)自归一化偏差在实践中可能具有优势,超过增加K带来的方差降低收益,表明这些估计器中存在偏差与方差之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。