Skip to main content
QUICK REVIEW

[论文解读] Collapse of Deep and Narrow Neural Nets

Lu Lu, Yanhui Su|arXiv (Cornell University)|Aug 15, 2018
Model Reduction and Neural Networks参考文献 46被引用 11
一句话总结

本论文表明,使用对称权重初始化的深层且狭窄的ReLU神经网络在训练过程中往往发生坍塌,无论使用何种优化器或损失函数,都会收敛到目标函数的错误均值或中值。坍塌源于狭窄架构中的梯度消失,可通过批量归一化或SELU缓解,而权重归一化和Dropout则无法防止该现象。

ABSTRACT

Recent theoretical work has demonstrated that deep neural networks have superior performance over shallow networks, but their training is more difficult, e.g., they suffer from the vanishing gradient problem. This problem can be typically resolved by the rectified linear unit (ReLU) activation. However, here we show that even for such activation, deep and narrow neural networks (NNs) will converge to erroneous mean or median states of the target function depending on the loss with high probability. Deep and narrow NNs are encountered in solving partial differential equations with high-order derivatives. We demonstrate this collapse of such NNs both numerically and theoretically, and provide estimates of the probability of collapse. We also construct a diagram of a safe region for designing NNs that avoid the collapse to erroneous states. Finally, we examine different ways of initialization and normalization that may avoid the collapse problem. Asymmetric initializations may reduce the probability of collapse but do not totally eliminate it.

研究动机与目标

  • 研究深层且狭窄的神经网络为何尽管具有理论优势,仍无法学习复杂函数。
  • 识别使用ReLU激活函数和对称初始化时,狭窄网络训练坍塌的根本原因。
  • 提供理论和数值证据,表明此类网络会收敛到常数输出(取决于损失函数,为均值或中值)。
  • 通过架构和归一化技术,提出实用的设计准则,以避免深层狭窄网络的坍塌。
  • 评估各种初始化和归一化方法在防止坍塌方面的有效性。

提出的方法

  • 理论分析证明,若网络变为常数,则所有前序层的梯度都会消失,导致收敛到常数输出。
  • 通过引理和定理推导坍塌的概率,表明坍塌概率随深度和狭窄程度增加,尤其在宽度为2的网络中更为显著。
  • 数值实验测试了一维和二维函数在MSE和MAE损失下的C⁰、C∞和L²正则性。
  • 研究比较了对称与非对称权重初始化(包括正交初始化和LSUV),并评估了BN、WN、SELU和Dropout的效果。
  • 基于理论坍塌概率估计,构建了安全区域图,以指导网络设计。
  • 通过测量收敛到正确函数值与错误的均值/中值状态的程度,评估了各种归一化技术的效果。

实验结果

研究问题

  • RQ1为何深层且狭窄的ReLU网络即使理论上能够逼近复杂函数,仍会失败?
  • RQ2训练过程中网络为何会坍塌到目标函数的均值或中值?
  • RQ3对称权重初始化如何导致狭窄网络中的坍塌现象?
  • RQ4像批量归一化或SELU这样的归一化技术能否防止深层狭窄网络的坍塌?
  • RQ5坍塌的理论概率是多少?如何对不同宽度和深度的网络进行估计?

主要发现

  • 使用对称初始化的深层且狭窄ReLU网络,无论优化器或训练时长如何,都会收敛到目标函数的均值(MSE损失下)或中值(MAE损失下)。
  • 理论分析表明,若网络变为常数,则所有权重和偏置的梯度都会消失,导致收敛到常数输出。
  • 对于宽度为2的网络,坍塌概率估计为1 - (1 - 2^{-d})^{L},其中L为深度,d为输入维度,表明在深层狭窄设置下风险极高。
  • 批量归一化和SELU通过保持非零梯度并避免饱和,成功防止了坍塌,而权重归一化因重参数化不变性而失效。
  • Dropout无法防止坍塌,因为它增加了稀疏性并强化了零激活,从而在狭窄架构中加剧了问题。
  • 构建了安全区域图,通过识别最小化坍塌风险的宽度-深度组合,为深层狭窄网络的设计提供指导。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。