[论文解读] Dropout as a Structured Shrinkage Prior
本文提出了一种贝叶斯视角下的dropout解释,通过精确重参数化,将dropout解释为结构化收缩先验——具体而言是高斯尺度混合(Gaussian scale mixture),揭示了dropout的蒙特卡洛训练目标近似于边缘MAP估计。主要贡献是一种针对残差网络的新先验,称为自动深度确定(automatic depth determination, ADD),可实现贝叶斯模型选择网络深度,在UCI回归基准测试中表现优于标准dropout,并与深度高斯过程相媲美。
Dropout regularization of deep neural networks has been a mysterious yet effective tool to prevent overfitting. Explanations for its success range from the prevention of "co-adapted" weights to it being a form of cheap Bayesian inference. We propose a novel framework for understanding multiplicative noise in neural networks, considering continuous distributions as well as Bernoulli noise (i.e. dropout). We show that multiplicative noise induces structured shrinkage priors on a network's weights. We derive the equivalence through reparametrization properties of scale mixtures and without invoking any approximations. Given the equivalence, we then show that dropout's Monte Carlo training objective approximates marginal MAP estimation. We leverage these insights to propose a novel shrinkage framework for resnets, terming the prior 'automatic depth determination' as it is the natural analog of automatic relevance determination for network depth. Lastly, we investigate two inference strategies that improve upon the aforementioned MAP approximation in regression benchmarks.
研究动机与目标
- 为深度神经网络中的dropout和乘性噪声提供严谨的贝叶斯解释,超越启发式说明。
- 在不使用近似的情况下,建立dropout与结构化收缩先验(高斯尺度混合)之间的精确等价关系。
- 为残差网络开发一种新型先验,实现通过贝叶斯推断自动选择网络深度。
- 通过提出定制化算法(包括尾部自适应重要性采样和变分EM)提升推断效率与准确性。
- 在回归基准测试中展示具有竞争力的性能,优于标准dropout,并与高容量贝叶斯模型相当。
提出的方法
- 将dropout表示为伯努利分布缩放因子的乘性噪声的特例,通过重参数化证明其与高斯尺度混合的精确等价性。
- 推导出乘性噪声会诱导一种结构化先验,其中权重缩放在各层间共享,类似于自动相关性确定(ARD)。
- 为残差网络提出一种新先验——自动深度确定(ADD),使模型能够学习哪些残差块是冗余的。
- 引入一种尾部自适应重要性采样方案,以改进dropout目标的蒙特卡洛估计,降低预测不确定性的偏差。
- 开发一种用于ARD和ADD先验的变分EM算法,实现对结构化收缩的有效贝叶斯推断。
- 将该框架应用于UCI基准数据集的回归任务,与dropout、概率反向传播和深度高斯过程进行性能比较。
实验结果
研究问题
- RQ1dropout在深度神经网络中与贝叶斯先验有何关系?其确切的分布含义是什么?
- RQ2通过重参数化,神经网络中的乘性噪声是否可解释为诱导出结构化收缩先验?
- RQ3能否将dropout的贝叶斯解释扩展到残差网络,以实现自动深度选择?
- RQ4与标准蒙特卡洛dropout相比,尾部自适应重要性采样和变分EM等替代推断策略在性能上如何提升?
- RQ5所提出的自动深度确定先验是否在回归基准测试中优于标准dropout及其他贝叶斯模型?
主要发现
- 尾部自适应重要性采样方法在七项UCI回归数据集中的五项上取得了最低的均方根误差(RMSE),表明预测精度得到提升。
- ARD-ADD先对于残差网络在所有测试模型中平均排名最佳,在七项数据集中的三项上表现强劲。
- 用于ARD-ADD先验的变分EM算法实现了有效的结构化收缩贝叶斯推断,平衡了逐行与全局的权重缩减。
- 所提出的框架将dropout的生成模型与推断过程解耦,使其可与MCMC等精确推断方法结合使用,而不同于以往的变分解释方法。
- ARD-ADD残差网络在性能上与通过期望传播训练的深度高斯过程(一种高容量贝叶斯模型)相当。
- 学习到的权重热力图证实,ARD-ADD同时诱导了行结构收缩和全局收缩,选择性地保留了重要残差块。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。