Skip to main content
QUICK REVIEW

[论文解读] Deep Residual Networks and Weight Initialization

Masato Taki|arXiv (Cornell University)|Sep 9, 2017
Advanced Neural Network Applications参考文献 15被引用 13
一句话总结

本文提出了一种用于深度残差网络(ResNets)的新颖权重初始化方案,通过降低对初始权重方差的敏感性,增强了训练稳定性。通过分析简化的ResNet模型,作者表明残差连接本质上减少了梯度消失/爆炸问题,其初始化方法在早期训练阶段实现了与批量归一化相当的性能,且无需额外计算开销。

ABSTRACT

Residual Network (ResNet) is the state-of-the-art architecture that realizes successful training of really deep neural network. It is also known that good weight initialization of neural network avoids problem of vanishing/exploding gradients. In this paper, simplified models of ResNets are analyzed. We argue that goodness of ResNet is correlated with the fact that ResNets are relatively insensitive to choice of initial weights. We also demonstrate how batch normalization improves backpropagation of deep ResNets without tuning initial values of weights.

研究动机与目标

  • 理解为何ResNets比标准深度网络对权重初始化更具鲁棒性。
  • 分析残差连接对深度网络中梯度流动和信号传播的影响。
  • 开发一种新的权重初始化方法,以在无需批量归一化的情况下提升深度ResNets的训练稳定性。
  • 在早期训练阶段,比较所提初始化方法与He初始化和批量归一化的有效性。
  • 研究即使在使用批量归一化的情况下,极深ResNets中梯度爆炸的理论极限。

提出的方法

  • 分析一个简化的ResNet模型,其中残差块由 $\boldsymbol{z}^{\ell} = f(\boldsymbol{W}^{\ell}\boldsymbol{z}^{\ell-1}) + \boldsymbol{z}^{\ell-1}$ 定义,假设权重分布为独立同分布且对称。
  • 推导输出和梯度的方差传播方程,表明ResNets表现出线性梯度增长 $\mathrm{Var}\left[\frac{\partial E}{\partial w^{\ell}}\right] \propto \frac{L}{\ell}$,而普通网络则呈现指数增长。
  • 提出一种新的初始化规则(公式28),通过控制初始权重方差 $\mathrm{Var}[w] = \frac{c}{nL}$ 来稳定训练,其中 $n$ 为输入通道数(fan-in),$L$ 为网络深度。
  • 将批量归一化引入理论分析,表明其可将梯度爆炸减少至线性增长,但在极深网络中仍会引发严重梯度爆炸。
  • 在CIFAR-10数据集上使用100层残差网络进行实验评估,比较所提初始化方法与He初始化和批量归一化的性能。
  • 利用方差传播和反向传播分析,量化各层梯度行为与信号稳定性。

实验结果

研究问题

  • RQ1为何ResNets比标准深度网络对权重初始化更不敏感?
  • RQ2残差连接结构如何影响深度网络中的梯度流动与信号传播?
  • RQ3能否通过一个简单的权重初始化规则,在深度ResNets中实现与批量归一化相当的训练稳定性?
  • RQ4即使使用批量归一化,极深ResNets中梯度爆炸的理论极限是什么?
  • RQ5与He初始化相比,所提初始化方法在早期训练阶段的稳定性与收敛性表现如何?

主要发现

  • 所提权重初始化在早期训练阶段实现了与批量归一化相当的稳定性,在CIFAR-10上训练一个周期后,验证准确率的均值为0.434,标准差为0.017。
  • 由于残差跳跃连接的存在,ResNets在前向和反向传播中能更好地保持信号幅度,因此本质上比普通网络对权重初始化更不敏感。
  • 深度ResNets中的梯度方差随深度呈线性增长($\mathrm{Var}\left[\frac{\partial E}{\partial w^{\ell}}\right] \propto \frac{L}{\ell}$),远比普通网络中观察到的指数增长更稳定。
  • 批量归一化可将梯度爆炸减少至线性增长,但在极深网络($L \gg 1$)中,尤其在早期层,仍会导致严重的梯度爆炸。
  • 所提初始化方法可在早期训练阶段避免使用批量归一化,提供一种计算开销极低的轻量级替代方案。
  • 即使使用批量归一化,极深ResNets仍面临残差梯度增长的理论限制,表明仅靠初始化无法在极端深度下完全解决该问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。