[论文解读] A Scale Mixture Perspective of Multiplicative Noise in Neural Networks
本文提出了一种贝叶斯高斯尺度混合框架,以解析理解深度神经网络中乘法噪声正则化的作用。通过将噪声重新参数化为层次先验,推导出一个闭式正则化惩罚项,该惩罚项偏好具有较大均值和方差的权重——从而促进鲁棒性而非稀疏性——并由此提出一种新型剪枝规则(SPR),其性能优于信噪比启发式方法,并在模型压缩中媲美知识蒸馏。
Corrupting the input and hidden layers of deep neural networks (DNNs) with multiplicative noise, often drawn from the Bernoulli distribution (or 'dropout'), provides regularization that has significantly contributed to deep learning's success. However, understanding how multiplicative corruptions prevent overfitting has been difficult due to the complexity of a DNN's functional form. In this paper, we show that when a Gaussian prior is placed on a DNN's weights, applying multiplicative noise induces a Gaussian scale mixture, which can be reparameterized to circumvent the problematic likelihood function. Analysis can then proceed by using a type-II maximum likelihood procedure to derive a closed-form expression revealing how regularization evolves as a function of the network's weights. Results show that multiplicative noise forces weights to become either sparse or invariant to rescaling. We find our analysis has implications for model compression as it naturally reveals a weight pruning rule that starkly contrasts with the commonly used signal-to-noise ratio (SNR). While the SNR prunes weights with large variances, seeing them as noisy, our approach recognizes their robustness and retains them. We empirically demonstrate our approach has a strong advantage over the SNR heuristic and is competitive to retraining with soft targets produced from a teacher model.
研究动机与目标
- 为乘法噪声正则化如何在深度神经网络中防止过拟合提供理论基础理解。
- 通过将乘法噪声建模为贝叶斯先验下的高斯尺度混合(GSM),解决深度网络中乘法噪声的解析不可解性。
- 推导出一个闭式正则化惩罚项,揭示乘法噪声的双重作用:促进权重稀疏性或对缩放的不变性。
- 基于推导出的惩罚项,提出一种基于数据驱动、原理严谨的权重剪枝策略,与信噪比(SNR)等启发式方法形成对比。
- 通过实证验证,所提出的剪枝规则(SPR)在模型压缩过程中保持性能优于SNR,并与知识蒸馏相媲美。
提出的方法
- 通过在网络权重上施加零均值高斯先验,并将噪声方差视为随机变量,将深度网络中的乘法噪声建模为高斯尺度混合(GSM)。
- 使用层次重新参数化使噪声与似然条件独立,从而支持类型-II最大似然估计。
- 推导出依赖于权重后验均值与方差的正则化惩罚项的闭式表达式:$\mathbb{E}^2[v] + \text{Var}[v]$。
- 提出一种新型剪枝规则——信号加鲁棒性(SPR):$|\mu_{l,j,k}| + \sigma_{l,j,k} < \tau$,该规则保留具有高均值和高方差的权重。
- 在使用伯努利乘法噪声训练后,应用拉姆齐蒙特卡洛(Langevin dynamics)从后验权重分布中采样,以实现对剪枝规则的实证评估。
- 在MNIST、IMDB和百万首歌曲数据集(MSD)上,针对分类与回归任务,将SPR剪枝与SNR和知识蒸馏(软目标微调)进行比较。
实验结果
研究问题
- RQ1乘法噪声正则化如何影响深度神经网络中网络权重的分布?
- RQ2能否利用贝叶斯层次框架解析求解深度网络中乘法噪声的功能复杂性?
- RQ3乘法噪声隐含的归纳偏置是什么——具体而言,它是否偏好稀疏性或对缩放的不变性?
- RQ4所推导的正则化惩罚项是否能带来优于现有启发式方法(如信噪比)的、更优的、原理严谨的权重剪枝策略?
- RQ5所提出的剪枝规则(SPR)是否能在实现更大模型压缩的同时,达到与知识蒸馏相媲美的性能?
主要发现
- 乘法噪声正则化诱导出高斯尺度混合,通过类型-II最大似然法实现正则化效应的闭式分析。
- 所推导的惩罚项偏好那些稀疏或对缩放具有不变性的权重,其中高方差权重表现出鲁棒性,并在新规则下得以保留。
- SPR剪枝规则($|\mu| + \sigma < \tau$)在测试误差显著上升前,允许比SNR启发式方法多移除至少20%的参数,表现更优。
- 在IMDB情感分类任务中,SPR剪枝模型在参数减少50%之前,性能与或优于微调后的软目标模型。
- 在MNIST、IMDB和MSD上的实证结果表明,SPR在多种数据模态和任务(包括回归)中均优于SNR,保持性能更佳。
- 分析表明,高方差权重并非噪声,而是鲁棒的,这与SNR启发式方法优先剪除它们的做法相矛盾。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。