Skip to main content
QUICK REVIEW

[论文解读] Channel Normalization in Convolutional Neural Network avoids Vanishing Gradients

Zhenwei Dai, Reinhard Heckel|arXiv (Cornell University)|Jul 22, 2019
Neural Networks and Applications参考文献 11被引用 18
一句话总结

本文表明,在单张图像上训练卷积神经网络时,通道归一化可防止梯度消失,这是深度图像先验和深度解码器应用中的关键设置。通过单独对每个通道进行归负化,梯度保持有界,从而实现高效优化;若不进行归一化,梯度下降在标准初始化下需要指数级多的步数才能收敛。

ABSTRACT

Normalization layers are widely used in deep neural networks to stabilize training. In this paper, we consider the training of convolutional neural networks with gradient descent on a single training example. This optimization problem arises in recent approaches for solving inverse problems such as the deep image prior or the deep decoder. We show that for this setup, channel normalization, which centers and normalizes each channel individually, avoids vanishing gradients, whereas, without normalization, gradients vanish which prevents efficient optimization. This effect prevails in deep single-channel linear convolutional networks, and we show that without channel normalization, gradient descent takes at least exponentially many steps to come close to an optimum. Contrary, with channel normalization, the gradients remain bounded, thus avoiding exploding gradients.

研究动机与目标

  • 研究通道归一化在卷积神经网络单样本训练中稳定梯度下降的作用。
  • 解决在单张图像上训练深度线性卷积网络时梯度消失的挑战。
  • 通过分析证明:若无通道归一化,梯度下降需指数级多的步数才能收敛。
  • 表明通道归一化可使梯度保持有界,从而实现更快、更稳定的优化。
  • 评估归一化对初始化时和训练过程中梯度分布的影响。

提出的方法

  • 使用具有循环权矩阵的单通道线性卷积网络来建模优化动态。
  • 在有和无通道归一化的条件下,对平方损失函数应用梯度下降。
  • 利用傅里叶变换对角化循环矩阵,将问题简化为n个一维优化任务。
  • 通过从损失函数推导出的解析表达式,分析初始化时和训练过程中的梯度范数与分布。
  • 在n=100且d=6层的合成数据上,通过经验分布比较归一化与未归一化梯度。
  • 在通道归一化中固定尺度和偏移参数(γ=1, β=0),以隔离归一化本身的影响,而非可学习参数的影响。

实验结果

研究问题

  • RQ1在单张图像上训练的深度卷积神经网络中,通道归一化是否能防止梯度消失?
  • RQ2在无归一化的情况下,收敛所需的优化步数如何随网络深度变化?
  • RQ3在有和无通道归一化的情况下,初始化时的梯度分布是怎样的?
  • RQ4归一化如何影响线性卷积网络中梯度下降的稳定性和收敛速度?
  • RQ5能否为具有循环权矩阵的简化线性模型,从理论上推导出收敛界?

主要发现

  • 若无通道归一化,即使步长η ≤ exp(cd)较大,梯度下降仍至少需要exp(Ω(d))步才能收敛到距离最优解c′以内的点。
  • 通过通道归一化,梯度保持有界且行为良好,避免了梯度消失和梯度爆炸问题。
  • 实验结果表明,无归一化时的梯度分布尾部显著比有归一化时更重,尤其是在初始化阶段。
  • 对于具有ReLU激活函数的单通道和多通道CNN,通道归一化均能带来更稳定和高效的训练。
  • 理论分析证实,归一化通过将梯度投影到当前估计的正交补空间中,稳定了优化景观。
  • 无论尺度和偏移参数是否可学习,通道归一化的性能均表现稳健,即使固定为γ=1, β=0亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。