Skip to main content
QUICK REVIEW

[论文解读] A Structured Variational Auto-encoder for Learning Deep Hierarchies of Sparse Features

Tim Salimans|arXiv (Cornell University)|Feb 28, 2016
Generative Adversarial Networks and Image Synthesis参考文献 4被引用 7
一句话总结

本文提出一种具有深层修正高斯潜变量的结构化变分自编码器,通过利用可微稀疏性与结构化后验近似,实现了无需逐层预训练的深度生成模型端到端联合训练。通过采用与生成模型依赖结构相匹配的结构化后验近似,并借助修正高斯分布实现可微稀疏性,该方法在二值化MNIST数据集上实现了-92.5纳特的测试变分下界,证明了在深层稀疏潜层次结构中实现有效学习的能力。

ABSTRACT

In this note we present a generative model of natural images consisting of a deep hierarchy of layers of latent random variables, each of which follows a new type of distribution that we call rectified Gaussian. These rectified Gaussian units allow spike-and-slab type sparsity, while retaining the differentiability necessary for efficient stochastic gradient variational inference. To learn the parameters of the new model, we approximate the posterior of the latent variables with a variational auto-encoder. Rather than making the usual mean-field assumption however, the encoder parameterizes a new type of structured variational approximation that retains the prior dependencies of the generative model. Using this structured posterior approximation, we are able to perform joint training of deep models with many layers of latent random variables, without having to resort to stacking or other layerwise training procedures.

研究动机与目标

  • 开发一种具有分层潜变量的深度生成模型,其具备类似脉冲-板型稀疏性,同时保持可微性以实现高效训练。
  • 解决在不依赖堆叠或逐层预训练流程的情况下,训练具有多层随机潜变量的深度模型的挑战。
  • 设计一种结构化变分后验近似,保留生成模型先验的依赖结构,从而提高后验近似精度。
  • 通过反向传播贯穿整个层次结构,实现深度分层模型的端到端训练。

提出的方法

  • 提出使用修正高斯分布作为可微稀疏性诱导先验,其定义为高斯分布与零的最大值,从而实现稀疏性与梯度传播的兼顾。
  • 构建一个深层分层生成模型,其中每一层的参数通过前一层的可学习权重和偏置递归计算,顶层的均值作为可学习参数。
  • 使用一种结构化变分后验,其与生成模型的条件依赖关系保持一致,每个潜变量的近似后验也建模为修正高斯分布。
  • 推导出每一层结构化后验与先验之间KL散度的解析表达式,从而实现变分下界的精确计算。
  • 通过随机梯度下降进行联合训练,使用变分下界无偏且可微的近似,同时在每一层应用批量归一化以提升稳定性。
  • 采用自底向上的推理网络计算变分后验的近似似然参数,用于KL散度的计算。

实验结果

研究问题

  • RQ1能否在无需逐层预训练的情况下,使用随机梯度变分推理对具有稀疏性的深层分层生成模型实现端到端训练?
  • RQ2如何在深层潜变量模型中实现可微稀疏性,同时保持高效后验推断的能力?
  • RQ3是否一种保留先验分层依赖结构的结构化变分后验能带来更优的后验近似与更深模型的训练稳定性?
  • RQ4在MNIST等基准数据集上,具有多层随机潜变量的模型是否能在对数似然性能上超越单层VAE?

主要发现

  • 该模型在二值化MNIST数据集上,采用4层分层结构(分别包含50、100、200和300个单元),实现了-92.5纳特的测试变分下界。
  • 使用修正高斯单元有效实现了类似脉冲-板型的稀疏性,同时保持可微性,使得梯度可反向传播至整个层次结构。
  • 结构化变分后验近似成功保留了生成模型的依赖结构,使得无需堆叠或逐层预训练即可实现深层模型的联合训练。
  • 在每一层应用批量归一化显著提升了训练稳定性与收敛速度,尤其在150个样本的小批量设置下效果明显。
  • 尽管模型深度与表达能力增强,其性能仍与具有多个确定性层的单层VAE相当,表明在此设置下,更深的随机层次结构尚未带来显著性能增益。
  • 该方法与现有深度学习优化技术(如Adamax)兼容,表明使用随机单元的深层分层模型可通过标准深度学习流水线实现高效训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。