Skip to main content
QUICK REVIEW

[论文解读] Adjusting for Dropout Variance in Batch Normalization and Weight Initialization

Dan Hendrycks, Kevin Gimpel|arXiv (Cornell University)|Jul 8, 2016
Advanced Neural Network Applications参考文献 13被引用 15
一句话总结

本文提出了一种新颖的权重初始化方法,通过将丢弃率和非线性特定因子纳入初始化尺度,以校正丢弃引起的方差问题,并引入了一种训练后批量归一化方差重估计算法。通过应用这些校正措施,作者在不使用数据增强的情况下,在CIFAR-10和CIFAR-100上实现了最先进(SOTA)的准确率,证明了在使用丢弃正则化的网络中,训练收敛性和稳定性得到了显著提升。

ABSTRACT

We show how to adjust for the variance introduced by dropout with corrections to weight initialization and Batch Normalization, yielding higher accuracy. Though dropout can preserve the expected input to a neuron between train and test, the variance of the input differs. We thus propose a new weight initialization by correcting for the influence of dropout rates and an arbitrary nonlinearity's influence on variance through simple corrective scalars. Since Batch Normalization trained with dropout estimates the variance of a layer's incoming distribution with some inputs dropped, the variance also differs between train and test. After training a network with Batch Normalization and dropout, we simply update Batch Normalization's variance moving averages with dropout off and obtain state of the art on CIFAR-10 and CIFAR-100 without data augmentation.

研究动机与目标

  • 为解决丢弃在神经网络训练中引入的方差不匹配问题,该问题同时影响权重初始化和批量归一化。
  • 开发一种简单、高效的权重初始化技术,能够考虑丢弃率和非线性压缩性,且无需依赖批量统计量或特殊前向传播。
  • 校正批量归一化在训练(启用丢弃)与推理(禁用丢弃)过程中移动方差估计之间的差异。
  • 在使用丢弃正则化的全连接网络和卷积网络中,提升训练稳定性和测试准确率。
  • 在CIFAR-10和CIFAR-100等标准基准上实现最先进性能,且无需数据增强。

提出的方法

  • 提出一种新的权重初始化缩放因子:$ W^{l} / \sqrt{ \mathbb{E}[f(z^{l-1})^2]/p + p\mathbb{E}[f'(z^l)^2] } $,其中 $ p $ 为丢弃保留率,$ f $ 为激活函数。
  • 推导前向和反向传播的方差校正方法,以在丢弃条件下稳定输入和梯度的分布。
  • 引入一种训练后的处理流程,通过在丢弃关闭状态下将训练集前向传播,并更新运行统计量,来重新估计批量归一化的移动方差。
  • 将该方法应用于全连接网络和DenseNets,证明其在不同架构中均具有一致的性能提升。
  • 当缺乏经验估计时,采用默认的0.5非线性压缩性校正因子,与Xavier和He初始化方法建立关联。
  • 采用单位超球面权重初始化并结合校正缩放,避免使用批量统计量和特殊前向传播。

实验结果

研究问题

  • RQ1丢弃如何影响神经元输入和梯度的方差?这种影响是否可通过权重初始化进行校正?
  • RQ2能否设计一种简单、非迭代的权重初始化方法,在不依赖批量统计量的前提下,稳定丢弃训练下的训练过程?
  • RQ3为何在使用丢弃训练时,批量归一化无法正确泛化?其方差估计如何在训练后进行校正?
  • RQ4能否通过训练后重估批量归一化的移动方差来提升标准视觉基准测试集上的测试准确率?
  • RQ5一种同时考虑前向和反向传播方差的统一初始化方案,是否能提升丢弃正则化下的收敛速度和准确率?

主要发现

  • 所提出的带丢弃校正的权重初始化方法,在20层全连接网络中,即使在不同丢弃率下,也能实现各层输入方差的稳定。
  • 在应用丢弃时,该方法在稳定性上优于Xavier和He初始化,可有效防止激活值爆炸或消失。
  • 通过在训练后使用关闭丢弃的训练集重新估计批量归一化的移动方差,CIFAR-10的测试误差从5.62%降低至5.38%。
  • 在CIFAR-100上,该方法在不使用数据增强的情况下,将测试误差从23.65%降低至22.17%,达到最先进性能。
  • 在某些配置下,该方法使准确率提升超过2%,在高度正则化设置下表现出显著增益。
  • 该方法在不同架构(包括DenseNets)中均具有通用性和有效性,无需修改网络结构,且推理阶段不增加额外计算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。