Skip to main content
QUICK REVIEW

[论文解读] Variational Dropout via Empirical Bayes

В. А. Харитонов, Dmitry Molchanov|arXiv (Cornell University)|Nov 1, 2018
Adversarial Robustness in Machine Learning参考文献 8被引用 7
一句话总结

该论文提出了一种基于经验贝叶斯的变分推理方法,用于深度神经网络中的自动相关性确定(ARD),为变分dropout提供了一种理论严谨的替代方案。通过将权重先验建模为具有可学习精度参数的高斯分布,该方法在不依赖不当先验的情况下,实现了与稀疏变分dropout相当的稀疏性和准确性,同时通过分层伽马超先验进一步优化了稀疏性-准确性权衡。

ABSTRACT

We study the Automatic Relevance Determination procedure applied to deep neural networks. We show that ARD applied to Bayesian DNNs with Gaussian approximate posterior distributions leads to a variational bound similar to that of variational dropout, and in the case of a fixed dropout rate, objectives are exactly the same. Experimental results show that the two approaches yield comparable results in practice even when the dropout rates are trained. This leads to an alternative Bayesian interpretation of dropout and mitigates some of the theoretical issues that arise with the use of improper priors in the variational dropout model. Additionally, we explore the use of the hierarchical priors in ARD and show that it helps achieve higher sparsity for the same accuracy.

研究动机与目标

  • 解决由于不当先验和奇异后验导致的变分dropout中的理论问题。
  • 通过使用恰当先验的变分推断,为dropout提供贝叶斯解释。
  • 通过具有因子化高斯后验的ARD,实现可训练的、层特定的dropout率。
  • 探索对超参数的分层先验,以改善稀疏性-准确性权衡。
  • 通过实证验证,AR D-based dropout在性能上与稀疏变分dropout相当或更优。

提出的方法

  • 使用经验贝叶斯方法学习高斯先验 p(w|τ) = ∏N(wi|0, τi⁻¹) 中的超参数 τ,实现自动相关性确定。
  • 应用双重随机变分推断(DSVI),采用因子化高斯变分后验 q(w|μ,σ) = ∏N(wi|μi,σi²) 近似真实后验。
  • 推导出证据下界(ELBO),当dropout率固定时,其与变分dropout目标一致;并通过 τi* = (μi² + σi²)⁻¹ 将其推广至可训练率。
  • 引入伽马超先验 p(τi|a,b) = Gamma(τi|a,b),并使用MAP-II估计法学习 a 和 b,实现对稀疏性的可控调节。
  • 表明边际先验 p(wi) 变为广义t分布,当 a,b→0 时,其退化为稀疏变分dropout中的对数均匀先验。
  • 采用局部重参数化梯度,高效优化 ELBO 关于 μ 和 σ 的参数。

实验结果

研究问题

  • RQ1具有恰当先验的ARD能否提供一种理论严谨的替代方案,避免变分dropout中的不当后验?
  • RQ2当dropout率可训练时,ARD与稀疏变分dropout的ELBO目标如何比较?
  • RQ3对ARD超参数的分层先验能否改善神经网络剪枝中的准确性-压缩权衡?
  • RQ4所提出的基于ARD的dropout方法是否在稀疏性和准确性上与稀疏变分dropout相当或更优?
  • RQ5在分层ARD模型下,边际先验与稀疏变分dropout中使用的对数均匀先验之间有何关系?

主要发现

  • 具有可训练dropout率的ARD目标(公式3)在实证上等价于稀疏变分dropout目标(公式4),两者在稀疏性和准确性上表现相近。
  • 在MNIST(LeNet-5)上,ARD Dropout达到0.76%错误率(±0.09)和132个压缩权重,与稀疏VD的0.81%错误率(±0.04)和136个压缩权重相当。
  • 在CIFAR-10(VGG-like)上,ARD Dropout达到7.75%错误率(±0.28)和34个压缩权重,优于稀疏VD的8.08%错误率(±0.27)和38个压缩权重。
  • 在CIFAR-10上使用伽马超先验(a=0.505, b=10⁻⁸)时,错误率为7.46%,压缩权重达52个,表明在相似准确率下实现了更高稀疏性。
  • 该方法避免了不当先验和奇异后验,解决了先前关于变分dropout研究中识别出的理论问题。
  • 在分层ARD模型下,边际先验在 a,b→0 时收敛至稀疏变分dropout中使用的对数均匀先验,建立了两种方法之间的理论联系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。