Skip to main content
QUICK REVIEW

[论文解读] A New Look at Ghost Normalization

Neofytos Dimitriou, Ognjen Arandjelović|arXiv (Cornell University)|Jul 16, 2020
Advanced Neural Network Applications参考文献 23被引用 4
一句话总结

本文提出顺序归一化(SeqNorm),一种新颖的归一化技术,通过依次应用鬼魂归一化(Ghost Normalization)和组归一化(Group Normalization),在不使用数据增强的情况下,在CIFAR-10和CIFAR-100上实现了最先进性能。该方法揭示了GhostNorm中一种独特的正则化机制,并通过损失景观可视化表明,GhostNorm降低了平滑度,从而提升了泛化能力,尤其在小批量大小下表现更优。

ABSTRACT

Batch normalization (BatchNorm) is an effective yet poorly understood technique for neural network optimization. It is often assumed that the degradation in BatchNorm performance to smaller batch sizes stems from it having to estimate layer statistics using smaller sample sizes. However, recently, Ghost normalization (GhostNorm), a variant of BatchNorm that explicitly uses smaller sample sizes for normalization, has been shown to improve upon BatchNorm in some datasets. Our contributions are: (i) we uncover a source of regularization that is unique to GhostNorm, and not simply an extension from BatchNorm, (ii) three types of GhostNorm implementations are described, two of which employ BatchNorm as the underlying normalization technique, (iii) by visualising the loss landscape of GhostNorm, we observe that GhostNorm consistently decreases the smoothness when compared to BatchNorm, (iv) we introduce Sequential Normalization (SeqNorm), and report superior performance over state-of-the-art methodologies on both CIFAR--10 and CIFAR--100 datasets.

研究动机与目标

  • 挑战一种广泛持有的观点,即由于统计估计不足,批量归一化(BatchNorm)在小批量大小下性能会下降。
  • 揭示鬼魂归一化(Ghost Normalization)中一种独特且不同于批量归一化的正则化来源。
  • 提出并实证验证一种新型归一化技术——顺序归一化(SeqNorm),其在图像分类基准上优于现有方法。
  • 开发一种高效的SeqNorm超参数调优策略,避免耗时的全网格搜索。
  • 可视化并分析GhostNorm的损失景观,揭示其对优化动态的影响。

提出的方法

  • 提出顺序归一化(SeqNorm),按顺序依次应用鬼魂归一化(GhostNorm)和组归一化(GroupNorm),以提升特征归一化效果和泛化能力。
  • 采用两阶段超参数调优策略:首先优化GhostNorm中的组数($G_M$),然后在最优$G_M$下调优GroupNorm中的组数($G_C$)。
  • 利用梯度累积和多GPU训练来模拟GhostNorm的小批量训练,从而在有限批量大小下仍能实现有效训练。
  • 可视化GhostNorm的损失景观,观察到其在训练后期尤其显著地降低了平滑度,相较于BatchNorm更具优势。
  • 提出一种新型GhostNorm实现方式,明确将小批量划分为更小的组进行独立归一化,增强随机性与正则化效果。
  • 采用顺序归一化流水线,将GhostNorm的输出输入至GroupNorm,使网络能够学习到更鲁棒且解耦的特征表示。

实验结果

研究问题

  • RQ1尽管使用更少的样本进行统计估计,鬼魂归一化为何能实现性能提升?
  • RQ2鬼魂归一化是否引入了一种在批量归一化中不存在的独特正则化形式?
  • RQ3将鬼魂归一化与组归一化按顺序结合,是否能带来优于单独使用任一方法的泛化能力?
  • RQ4GhostNorm的损失景观与BatchNorm相比如何?这对优化动态有何启示?
  • RQ5能否为SeqNorm设计一种更高效的超参数调优策略,避免全网格搜索的同时保持性能?

主要发现

  • 在CIFAR-100上,GhostNorm在$G_M = 8$时达到82.8%的测试准确率,优于BatchNorm(82.1%),尽管每组仅使用4个样本进行归一化。
  • 在CIFAR-100上,SeqNorm在$G_C = 4$且$G_M = 8$时达到83.8%的测试准确率,超越了该数据集当前最先进方法,且无需数据增强。
  • 在CIFAR-10上,SeqNorm在$G_C = 16$且$G_M = 8$时达到97.4%的测试准确率,与当前最先进方法持平,但采用更简单的训练设置。
  • 损失景观可视化显示,GhostNorm在训练后期持续降低平滑度,相较于BatchNorm更具优势,表明其优化路径更复杂但可能更具泛化能力。
  • 所提出的$G_M$与$G_C$的顺序调优策略将时间复杂度降低至$\Theta(G_C + G_M)$,显著加快了超参数搜索速度,优于全网格搜索。
  • 实验表明,若在SeqNorm中颠倒GhostNorm与GroupNorm的顺序,或同时使用两者,性能均会下降,证实了顺序应用的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。