Skip to main content
QUICK REVIEW

[论文解读] Layer-wise learning of deep generative models

Ludovic Arnold, Yann Ollivier|arXiv (Cornell University)|Dec 7, 2012
Generative Adversarial Networks and Image Synthesis参考文献 10被引用 12
一句话总结

本文提出一种用于深度生成模型的逐层训练方法,采用一种乐观代理——最优潜在边缘(BLM)上界,自下而上引导训练。该方法在温和条件下可近似全局最优,并通过实验证明:当从数据到潜在变量的推理模型(inference model)比从潜在变量到数据的生成模型(generative model)更丰富时,性能显著提升,优于在合成数据集和真实数据集上的堆叠RBM模型。

ABSTRACT

When using deep, multi-layered architectures to build generative models of data, it is difficult to train all layers at once. We propose a layer-wise training procedure admitting a performance guarantee compared to the global optimum. It is based on an optimistic proxy of future performance, the best latent marginal. We interpret auto-encoders in this setting as generative models, by showing that they train a lower bound of this criterion. We test the new learning procedure against a state of the art method (stacked RBMs), and find it to improve performance. Both theory and experiments highlight the importance, when training deep architectures, of using an inference model (from data to hidden variables) richer than the generative model (from hidden variables to data).

研究动机与目标

  • 为解决因梯度不可计算和高维潜在空间导致的端到端训练深度生成模型的挑战。
  • 为逐层训练提供理论依据,证明其可近似对数似然的全局最优。
  • 强调使用比生成模型更丰富的推理模型(从数据到潜在变量)的重要性。
  • 在合成数据集和真实深度数据集上对方法进行实证验证,并与最先进的堆叠RBM模型进行比较。
  • 引入并评估具有丰富推理能力的自编码器(AERIes),作为该框架的实际实现。

提出的方法

  • 引入BLM上界作为未来性能的乐观代理,假设上层网络能成功训练。
  • 使用BLM上界训练下层网络,其准则定义为 $ \hat{\mathcal{U}}_{\mathcal{D},q}(\theta_I) = \mathbb{E}_{\mathbf{x} \sim P_{\mathcal{D}}} \left[ \log \sum_{\tilde{\mathbf{x}}} \sum_{\mathbf{h}} P_{\theta_I}(\mathbf{x}|\mathbf{h}) q(\mathbf{h}|\tilde{\mathbf{x}}) P_{\mathcal{D}}(\tilde{\mathbf{x}}) \right] $。
  • 对大规模模型采用基于采样的近似 $ \hat{\hat{\mathcal{U}}}_{\mathcal{D},q}(\theta_I) $,每个数据点使用K个样本。
  • 将自编码器重新解释为优化BLM准则的下界,为自编码器在深度生成建模中的应用提供了新的理论依据。
  • 通过增强推理模型 $ q(\mathbf{h}|\mathbf{x}) $ 而保持生成模型 $ P_{\theta_I}(\mathbf{x}|\mathbf{h}) $ 不变,提出AERIes(具有丰富推理的自编码器)。
  • 使用BLM上界作为验证对数似然的代理,以指导超参数选择和模型评估。

实验结果

研究问题

  • RQ1能否从理论上证明,基于BLM上界的逐层训练方法可近似对数似然的全局最优?
  • RQ2从数据到潜在变量的推理模型复杂度选择,如何影响深度生成模型的性能?
  • RQ3在训练和超参数调优过程中,BLM上界能否作为未来模型性能的可靠代理?
  • RQ4在保持生成模型不变的前提下,增强推理模型是否能带来优于标准自编码器或堆叠RBM的性能?
  • RQ5在深度生成模型中,BLM上界是否比对数似然更适合用作模型选择的标准?

主要发现

  • 在温和假设下,基于BLM上界的逐层训练方法可严格近似全局最优,并在乐观假设失效时提供形式化的性能界。
  • BLM上界与实际验证对数似然的相关性优于直接的对数似然估计,因此作为超参数选择的代理指标更优。
  • 具有丰富推理能力的自编码器(AERIes)在合成数据集和真实深度数据集上均优于标准自编码器和堆叠RBM,验证了表达性推理模型的优势。
  • 实验表明,通过采样(K=1)计算的BLM上界与精确上界非常接近,验证了该近似方法在大规模模型中的有效性。
  • 该方法成功实现了从低层到高层的迁移学习,BLM上界在整个训练过程中作为稳定且信息丰富的准则。
  • 实证结果证实,使用比生成模型更丰富的推理模型可显著提升性能,验证了理论直觉:推理比生成更困难。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。