[论文解读] Ladder Variational Autoencoders
该论文提出了层级变分自编码器(Ladder Variational Autoencoder, LVAE),一种深度生成模型,通过在推理过程中整合自顶向下的、与数据相关的修正,并在推理模型与生成模型之间共享参数,从而改进变分推断。这使得似然下界显著收紧,并在MNIST、OMNIGLOT和NORB数据集上实现了最先进水平的对数似然性能,同时学习到比标准VAE更深层、更分布式的层次表征。
Variational Autoencoders are powerful models for unsupervised learning. However deep models with several layers of dependent stochastic variables are difficult to train which limits the improvements obtained using these highly expressive models. We propose a new inference model, the Ladder Variational Autoencoder, that recursively corrects the generative distribution by a data dependent approximate likelihood in a process resembling the recently proposed Ladder Network. We show that this model provides state of the art predictive log-likelihood and tighter log-likelihood lower bound compared to the purely bottom-up inference in layered Variational Autoencoders and other generative models. We provide a detailed analysis of the learned hierarchical latent representation and show that our new inference model is qualitatively different and utilizes a deeper more distributed hierarchy of latent variables. Finally, we observe that batch normalization and deterministic warm-up (gradually turning on the KL-term) are crucial for training variational models with many stochastic layers.
研究动机与目标
- 改进具有多个随机层的深度变分自编码器的训练与性能。
- 解决纯自底向上推理在VAE中难以利用深层层次结构的局限性。
- 探究具有自顶向下反馈的结构化推理是否能增强生成建模与表征学习。
- 评估批量归一化与确定性预热对训练深度随机模型的影响。
提出的方法
- 提出一种新型推理模型——Ladder VAE(LVAE),通过使用与数据相关的似然估计,对生成分布进行自顶向下的、精度加权的修正。
- 引入一种递归推理机制,其中每一层的后验分布通过结合自底向上的似然与自顶向下的先验进行计算,且与生成模型共享参数。
- 对高斯潜在变量采用重参数化技巧以实现通过随机反向传播,并在可能时解析计算KL散度。
- 采用分层先验结构,其中每一层潜在变量依赖于下一层,从而实现深层、结构化的表征。
- 应用批量归一化与确定性预热调度以稳定深度随机模型的训练。
- 采用带重要性加权的变分下界,以获得更紧的似然估计。
实验结果
研究问题
- RQ1具有自顶向下反馈的结构化推理模型能否提升深度VAE的生成性能?
- RQ2与纯自底向上VAE推理相比,LVAE的推理机制在对数似然与表征质量方面表现如何?
- RQ3批量归一化与预热对训练深度VAE与LVAE的影响是什么?
- RQ4LVAE是否学习到比标准VAE更深层、更分布式的层次表征?
- RQ5LVAE是否能在不使用复杂推理架构(如归一化流或辅助网络)的情况下实现最先进性能?
主要发现
- 在MNIST上,LVAE的测试集对数似然达到−85.81,显著优于标准VAE,并与更复杂的模型(如IWAE和带归一化流的VAE)相当或更优。
- 在OMNIGLOT上,LVAE的测试对数似然为−102.11,优于此前更复杂模型使用50个重要性样本所得的最优结果−103.38。
- LVAE学习到更深层、更分布式的潜在表征:五个层全部活跃,KL散度在各层间分布更均匀,而标准VAE则导致高层层坍塌。
- 批量归一化与确定性预热对训练深度随机模型至关重要,其中预热可激活更多神经元并防止过早坍塌。
- PCA可视化显示,即使在顶层潜在层,LVAE仍保持结构化、类可分的表征,而VAE的高层则坍塌至先验分布。
- 与标准VAE相比,LVAE对真实对数似然提供了更紧的下界,表明其对真实后验分布的近似更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。