Skip to main content
QUICK REVIEW

[论文解读] Online Normalization for Training Neural Networks

Vitaliy Chiley, Ilya Sharapov|arXiv (Cornell University)|May 1, 2019
Neural Networks and Applications被引用 23
一句话总结

本文提出在线归一化(Online Normalization),一种无需依赖小批量的神经网络隐藏激活归一化技术,采用与自动微分兼容的无偏梯度计算方法。该方法在图像分类、语义分割和语言建模等任务中实现了与批量归一化(Batch Normalization)相当的性能,使在无法使用小批量的场景下进行训练成为可能。

ABSTRACT

Online Normalization is a new technique for normalizing the hidden activations of a neural network. Like Batch Normalization, it normalizes the sample dimension. While Online Normalization does not use batches, it is as accurate as Batch Normalization. We resolve a theoretical limitation of Batch Normalization by introducing an unbiased technique for computing the gradient of normalized activations. Online Normalization works with automatic differentiation by adding statistical normalization as a primitive. This technique can be used in cases not covered by some other normalizers, such as recurrent networks, fully connected networks, and networks with activation memory requirements prohibitive for batching. We show its applications to image classification, image segmentation, and language modeling. We present formal proofs and experimental results on ImageNet, CIFAR, and PTB datasets.

研究动机与目标

  • 解决批量归一化在理论上存在的局限性,特别是其对小批量的依赖以及梯度计算的偏差问题。
  • 在无法使用小批量的架构中实现有效的归一化,例如循环神经网络和对内存要求较高的全连接网络。
  • 通过将统计归一化作为原语操作集成,开发一种与自动微分兼容的归一化技术。
  • 在不依赖小批量统计量的前提下,实现与批量归一化相当的训练稳定性和准确性。
  • 将归一化技术的应用范围扩展至序列模型和内存密集型深度学习模型。

提出的方法

  • 提出一种新颖的、无偏的归一化激活梯度计算技术,克服了批量归一化中一个关键的理论缺陷。
  • 在自动微分框架中将归一化形式化为原语操作,实现端到端训练与梯度流动。
  • 通过运行估计的均值和方差,在训练过程中在线计算小批量统计量,避免对固定小批量的依赖。
  • 对隐藏激活的样本维度进行归一化,类似于批量归一化,但无需依赖小批量级别的统计量。
  • 使用递归更新规则维护运行统计量,以在处理序列或可变长度输入时保持训练过程中的归一化准确性。
  • 将归一化层作为可微分组件集成,可在反向传播中无偏差地传播梯度。

实验结果

研究问题

  • RQ1能否开发一种归一化技术,避免批量归一化的批处理依赖,同时保持相当的性能?
  • RQ2是否能够以与自动微分兼容的方式,为归一化激活计算无偏梯度?
  • RQ3在线归一化能否在小批量不可行的循环网络和全连接网络中有效稳定训练?
  • RQ4在不同任务中,与批量归一化相比,在准确率和收敛性方面,在线归一化的表现如何?
  • RQ5在线归一化是否能在不同架构和数据集上泛化,包括图像建模和序列建模任务?

主要发现

  • 在线归一化在ImageNet上的测试准确率与批量归一化相当或更优,证明了其性能的对等性。
  • 该方法使在因内存或序列约束而无法使用批量归一化的循环网络和全连接网络中实现稳定训练成为可能。
  • 在CIFAR-10和CIFAR-100上的实验表明,在线归一化在不依赖小批量统计量的情况下仍能保持高准确率。
  • 在PTB语言建模数据集上,在线归一化取得了具有竞争力的困惑度得分,证实了其在序列建模中的有效性。
  • 理论分析表明,在线归一化提供了无偏的梯度估计,解决了批量归一化的一个关键局限性。
  • 该技术与自动微分框架兼容,可无缝集成到现代深度学习流水线中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。