Skip to main content
QUICK REVIEW

[论文解读] The Normalization Method for Alleviating Pathological Sharpness in Wide Neural Networks

Ryo Karakida, Shotaro Akaho|arXiv (Cornell University)|Jun 7, 2019
Neural Networks and Applications被引用 15
一句话总结

本文通过Fisher信息矩阵(FIM)分析宽深度神经网络中归一化方法的理论机制,量化损失曲面的尖锐程度。研究结果表明,在特定宽度和样本量条件下,仅在最后一层应用批量归一化(batch normalization)能显著降低由异常大的FIM特征值定义的病态尖锐性;而隐藏层的批量归一化或层归一化(layer normalization)则无法实现这一效果。

ABSTRACT

Normalization methods play an important role in enhancing the performance of deep learning while their theoretical understandings have been limited. To theoretically elucidate the effectiveness of normalization, we quantify the geometry of the parameter space determined by the Fisher information matrix (FIM), which also corresponds to the local shape of the loss landscape under certain conditions. We analyze deep neural networks with random initialization, which is known to suffer from a pathologically sharp shape of the landscape when the network becomes sufficiently wide. We reveal that batch normalization in the last layer contributes to drastically decreasing such pathological sharpness if the width and sample number satisfy a specific condition. In contrast, it is hard for batch normalization in the middle hidden layers to alleviate pathological sharpness in many settings. We also found that layer normalization cannot alleviate pathological sharpness either. Thus, we can conclude that batch normalization in the last layer significantly contributes to decreasing the sharpness induced by the FIM.

研究动机与目标

  • 通过分析损失曲面的几何结构,理论理解归一化方法为何能提升深度学习性能。
  • 研究批量归一化与层归一化在宽、随机初始化的深度神经网络中对Fisher信息矩阵(FIM)的影响。
  • 识别在何种条件下,归一化方法可缓解FIM中病态大的特征值(对应于尖锐极小值)的问题。
  • 阐明归一化在深层网络不同层中所起的差异化作用,特别是最后一层与隐藏层之间的差异。

提出的方法

  • 使用Fisher信息矩阵(FIM)刻画宽深度神经网络在随机权重下的损失曲面局部几何结构。
  • 结合随机矩阵理论与平均场分析,推导在大宽度极限下FIM的渐近表达式。
  • 识别与最大FIM特征值对应的特征子空间,以定位病态尖锐性的来源。
  • 推导序参量的收敛速率,建立最后一层批量归一化降低尖锐性的条件。
  • 通过解析推导与渐近近似,比较批量归一化(最后一层与隐藏层)及层归一化下的FIM行为。
  • 利用序参量的递推关系计算逆FIM,并分析归一化网络中的特征值统计特性。

实验结果

研究问题

  • RQ1在何种条件下,最后一层的批量归一化可缓解宽深度神经网络中的病态尖锐性?
  • RQ2为何尽管在实践中批量归一化能改善训练动态,其在隐藏层中仍无法降低尖锐性?
  • RQ3与批量归一化相比,层归一化在FIM和损失曲面几何结构方面的影响如何?
  • RQ4网络宽度与训练样本量在决定归一化方法缓解FIM相关尖锐性方面的有效性中起何作用?
  • RQ5FIM能否作为理论工具,解释归一化在深度学习中带来的泛化与优化优势?

主要发现

  • 当网络宽度与样本量满足特定收敛条件时,最后一层批量归一化可显著降低Fisher信息矩阵(FIM)的最大特征值,从而缓解病态尖锐性。
  • 最后一层批量归一化的有效性取决于序参量的收敛速率,当宽度与样本量按适当比例增长时,尖锐性才会降低。
  • 在大多数设定下,隐藏层的批量归一化无法缓解病态尖锐性,因为网络的分层结构导致FIM的最大特征值仍保持较大。
  • 层归一化同样无法降低病态尖锐性,因为在此归一化方式下,FIM的最大特征值未被有效抑制。
  • 当输出单元数C=2时,由于均值减除与方差归一化的对称性,FIM变为零,表明这是一种退化情形,不适用于典型设置。
  • 实验表明,最后一层批量归一化带来的尖锐性降低可支持更大的学习率并实现更快收敛,验证了其实际有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。