Skip to main content
QUICK REVIEW

[论文解读] Automatic Relevance Determination For Deep Generative Models

Theofanis Karaletsos, Gunnar Rätsch|arXiv (Cornell University)|May 28, 2015
Gaussian Processes and Bayesian Inference参考文献 19被引用 6
一句话总结

本文提出了一种双重随机变分推断框架,并结合自动相关性确定(ARD),以在深度生成模型中自动剪枝冗余的潜在维度。通过在潜在变量权重上施加因子型先验,并利用随机梯度估计,该方法在不损失模型性能的前提下,实现了紧凑且可解释的表征,展示了显著的潜在空间压缩效果,同时在基准数据上保持了较高的似然度。

ABSTRACT

A recurring problem when building probabilistic latent variable models is regularization and model selection, for instance, the choice of the dimensionality of the latent space. In the context of belief networks with latent variables, this problem has been adressed with Automatic Relevance Determination (ARD) employing Monte Carlo inference. We present a variational inference approach to ARD for Deep Generative Models using doubly stochastic variational inference to provide fast and scalable learning. We show empirical results on a standard dataset illustrating the effects of contracting the latent space automatically. We show that the resulting latent representations are significantly more compact without loss of expressive power of the learned models.

研究动机与目标

  • 解决在深度生成模型中确定最优潜在空间维度的问题,而无需手动调整超参数。
  • 通过合理的正则化方法,实现基于数据的自动剪枝,去除无关的潜在维度。
  • 通过学习潜在变量上的相关性掩码,提升模型的紧凑性与可解释性。
  • 利用高效的随机梯度推断方法,将 ARD 扩展至深度生成模型。

提出的方法

  • 通过在推理网络权重上施加层次先验,应用自动相关性确定(ARD),促使潜在维度呈现稀疏性。
  • 使用双重随机变分推断(SGVB)通过重参数化梯度近似潜在变量和模型参数的后验分布。
  • 在潜在维度上施加因子型先验,以实现对各维度相关性的独立估计,从而实现有效剪枝。
  • 推导出一个变分下界,该下界同时对潜在变量和梯度估计器中的随机性进行积分,从而支持端到端训练。
  • 提出两种变体:SGVB-ARD(基于随机梯度)和 GSGVB-ARD(解析积分),二者在梯度稳定性和收敛行为上有所不同。
  • 使用蒙特卡洛样本的梯度估计进行随机优化训练,从而实现对高维数据的可扩展性。

实验结果

研究问题

  • RQ1ARD 是否能有效应用于深度生成模型,以自动确定潜在空间的有效维度?
  • RQ2基于 ARD 的剪枝对模型似然度、重建质量以及潜在空间紧凑性有何影响?
  • RQ3与标准 SGVB 相比,使用双重随机变分推断结合 ARD 对训练稳定性和收敛性有何影响?
  • RQ4ARD 学习到的相关性掩码是否提升了潜在表征的可解释性?
  • RQ5在数据稀缺的场景下,ARD 在不同初始潜在空间大小下的性能表现如何?

主要发现

  • SGVB-ARD 成功剪枝了潜在维度,在实验中将有效维度降低至约 9,远低于初始的 200 或 400 个单元。
  • 与标准 SGVB 相比,所得模型在训练集和测试集上均获得了更高的似然度,表明泛化能力得到提升。
  • GSGVB-ARD 的训练动态比 SGVB-ARD 更为稳定,梯度噪声更小,收敛更平滑,尽管需要更长的训练时间才能完全收敛。
  • ARD 导致顶层权重出现强烈收缩,表明压缩效应在生成网络中具有传播性。
  • 使用 ARD 训练的模型在实现显著更紧凑的表征的同时,仍能保持高质量的重建结果。
  • 即使没有显式正则化,SGVB 也能学习到对潜在维度的剪枝,表明 ARD 增强了模型对紧凑性的自然归纳偏置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。