Skip to main content
QUICK REVIEW

[论文解读] Revisiting Reweighted Wake-Sleep

Tuan Anh Lê, Adam R. Kosiorek|arXiv (Cornell University)|Sep 27, 2018
Generative Adversarial Networks and Image Synthesis参考文献 22被引用 10
一句话总结

本文重新审视了用于训练离散隐变量模型的重加权唤醒-睡眠(RWS)算法,证明其通过消除对控制变量和路径导数的依赖,避免了高方差梯度估计。RWS在性能上优于当前最先进方法,能利用更多粒子学习到更优的模型,并且在连续模型上也表现出良好的泛化能力。

ABSTRACT

Discrete latent-variable models, while applicable in a variety of settings, can often be difficult to learn. Sampling discrete latent variables can result in high-variance gradient estimators for two primary reasons: 1. branching on the samples within the model, and 2. the lack of a pathwise derivative for the samples. While current state-of-the-art methods employ control-variate schemes for the former and continuous-relaxation methods for the latter, their utility is limited by the complexities of implementing and training effective control-variate schemes and the necessity of evaluating (potentially exponentially) many branch paths in the model. Here, we revisit the reweighted wake-sleep (RWS) (Bornschein and Bengio, 2015) algorithm, and through extensive evaluations, show that it circumvents both these issues, outperforming current state-of-the-art methods in learning discrete latent-variable models. Moreover, we observe that, unlike the importance weighted autoencoder, RWS learns better models and inference networks with increasing numbers of particles, and that its benefits extend to continuous latent-variable models as well. Our results suggest that RWS is a competitive, often preferable, alternative for learning deep generative models.

研究动机与目标

  • 解决训练离散隐变量模型过程中高方差梯度估计的问题。
  • 克服控制变量方案和连续松弛方法在处理离散隐变量时的局限性。
  • 评估RWS是否在模型和推理网络学习方面优于现有方法。
  • 研究RWS的优势是否随着模型中粒子数量的增加而扩展。
  • 探索RWS在离散模型之外的连续隐变量设置中的适用性。

提出的方法

  • 重新审视Bornschlein和Bengio(2015)最初提出的用于训练具有离散隐变量的深度生成模型的重加权唤醒-睡眠(RWS)算法。
  • 利用多个粒子上的重加权方案来估计梯度,而无需依赖路径导数或控制变量。
  • 采用唤醒-睡眠更新规则,其中生成模型使用推理模型的后验进行更新,反之亦然,并结合基于粒子的重加权。
  • 通过在多个样本上应用重要性加权来降低梯度估计方差,而无需可微采样。
  • 将RWS框架应用于离散和连续隐变量模型,以评估其泛化能力和可扩展性。
  • 在多个基准数据集上进行广泛的实验评估,将RWS与当前最先进基线方法进行比较。

实验结果

研究问题

  • RQ1RWS是否能在不依赖控制变量或连续松弛的情况下,有效缓解离散隐变量模型中的高方差梯度估计问题?
  • RQ2增加RWS中的粒子数量是否能带来模型和推理网络学习性能的提升?
  • RQ3与重要性加权自编码器及其他最先进方法相比,RWS在模型质量与训练稳定性方面表现如何?
  • RQ4RWS是否可成功扩展至连续隐变量模型?在这些设置中是否仍保持其优势?
  • RQ5粒子数量对RWS在离散和连续设置下性能的影响是什么?

主要发现

  • RWS通过避免复杂控制变量方案和连续松弛的依赖,在学习离散隐变量模型方面优于当前最先进方法。
  • 随着粒子数量的增加,RWS在模型和推理网络质量方面均表现更优,表明其具有稳定的可扩展性和持续改进能力。
  • 与重要性加权自编码器不同,RWS在粒子数量增加时不会出现收益递减现象,且能持续保持显著的性能提升。
  • RWS的优势不仅限于离散模型,在连续隐变量模型中也表现出具有竞争力的性能。
  • RWS在不依赖可微采样或辅助训练组件的情况下,有效降低了梯度方差,展现出良好的鲁棒性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。