Skip to main content
QUICK REVIEW

[论文解读] Batch Normalization Preconditioning for Neural Network Training

Susanna Lange Susanna Lange, Kyle Helfrich|arXiv (Cornell University)|Aug 2, 2021
Stochastic Gradient Optimization Techniques参考文献 42被引用 7
一句话总结

本文提出批量归一化预处理(BNP),一种新颖的方法,通过使用小批量统计量对参数梯度进行预处理,而非在神经网络架构中应用归一化,从而改善神经网络训练。BNP通过改善海森矩阵的条件性实现更快收敛,适用于小批量或单样本小批量设置,并为批归一化为何能提升训练效果提供了理论见解,在在线学习和低批量设置下优于标准批归一化。

ABSTRACT

Batch normalization (BN) is a popular and ubiquitous method in deep learning that has been shown to decrease training time and improve generalization performance of neural networks. Despite its success, BN is not theoretically well understood. It is not suitable for use with very small mini-batch sizes or online learning. In this paper, we propose a new method called Batch Normalization Preconditioning (BNP). Instead of applying normalization explicitly through a batch normalization layer as is done in BN, BNP applies normalization by conditioning the parameter gradients directly during training. This is designed to improve the Hessian matrix of the loss function and hence convergence during training. One benefit is that BNP is not constrained on the mini-batch size and works in the online learning setting. Furthermore, its connection to BN provides theoretical insights on how BN improves training and how BN is applied to special architectures such as convolutional neural networks. For a theoretical foundation, we also present a novel Hessian condition number based convergence theory for a locally convex but not strong-convex loss, which is applicable to networks with a scale-invariant property.

研究动机与目标

  • 为解决批归一化(BN)的理论局限性,尽管其被广泛使用,但缺乏完整的理论基础。
  • 开发一种预处理方法,通过使用小批量统计量直接调节损失函数的海森矩阵,以改善训练收敛性。
  • 提出一种方法,在保持BN优势的同时,能在批归一化失效的低样本或单样本小批量设置中有效工作。
  • 提供理论解释,说明为何批归一化能改善训练,通过将其与海森矩阵调节和收敛速率联系起来。
  • 通过BNP框架,为卷积神经网络(CNNs)中的批归一化提供一个合理的应用方式。

提出的方法

  • BNP在训练过程中通过对参数梯度进行预处理来实现,使用小批量统计量对梯度进行变换,而非像标准BN那样对隐藏激活值进行归一化。
  • 该方法通过调节损失函数的海森矩阵,隐式地对隐藏变量的方差进行归一化,改善其条件数,从而加速收敛。
  • 预处理变换源自损失函数的海森矩阵,在特定条件下等价于BN,建立了理论上的等价性。
  • BNP使用当前小批量甚至更大数据集的统计量,增强了统计估计的灵活性,避免了对小批量大小的依赖。
  • 该方法通过在空间和通道维度上推导适当的统计量(均值和方差),被扩展至CNNs,从而为CNN中标准BN的应用提供了理论依据。
  • 为局部凸但非强凸的损失函数,提出了一种基于海森矩阵条件数的新型收敛性理论,适用于如ReLU激活函数的尺度不变网络。

实验结果

研究问题

  • RQ1如何通过海森矩阵调节和收敛性分析,从理论上解释批归一化?
  • RQ2能否开发一种基于预处理的批归一化替代方法,避免架构修改,并适用于在线学习或低批量设置?
  • RQ3批归一化与所提出的预处理方法在等价性和收敛行为方面有何关系?
  • RQ4批归一化在卷积神经网络中应如何正确应用?能否从一个合理的理论框架中推导出这一方法?
  • RQ5在极小批量或单样本小批量等挑战性设置下,所提出的方法是否优于标准批归一化?

主要发现

  • BNP在标准训练设置下性能与BN相当,但在低样本或单样本小批量场景下显著优于BN。
  • BNP在在线学习设置中表现有效,而BN因小批量导致的统计不稳定性而失效。
  • 理论分析表明,BNP改善了海森矩阵的条件数,从而在局部凸但非强凸的损失曲面中实现更快收敛。
  • 在特定条件下,BNP与BN在理论上等价,为批归一化通过改善海森矩阵条件性来提升训练效果提供了新解释。
  • BNP在CNN中的推导自然导出在空间和通道维度上使用小批量统计量,为CNN中标准BN的应用提供了理论支持。
  • 在MNIST、CIFAR-10、CIFAR-100和ImageNet上的实验表明,BNP在小批量设置下保持或提升了准确率和训练速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。