Skip to main content
QUICK REVIEW

[論文レビュー] Batch Group Normalization

Xiao-Yun Zhou, Jiacheng Sun|arXiv (Cornell University)|Dec 4, 2020
Advanced Neural Network Applications参考文献 75被引用数 10
ひとこと要約

バッチグループ正規化(BGN)は、チャネル、高さ、幅の次元にわたるグループベースの統計計算を導入することで、小規模および極めて大規模なバッチサイズにおけるバッチ正規化(BN)の性能低下を是正する。この手法は、グループサイズを制御するハイパーパramータ G を用いる。BGN は、画像分類、少サンプル学習(FSL)、ドメイン適応を含む多様なビジョンタスクにおいて、最先端の精度を達成し、バッチサイズが 2 の条件下で ImageNet で Top-1 精度 76.096% を達成した。これは、同じ条件下で BN が達成した 66.512% より顕著に優れている。

ABSTRACT

Deep Convolutional Neural Networks (DCNNs) are hard and time-consuming to train. Normalization is one of the effective solutions. Among previous normalization methods, Batch Normalization (BN) performs well at medium and large batch sizes and is with good generalizability to multiple vision tasks, while its performance degrades significantly at small batch sizes. In this paper, we find that BN saturates at extreme large batch sizes, i.e., 128 images per worker, i.e., GPU, as well and propose that the degradation/saturation of BN at small/extreme large batch sizes is caused by noisy/confused statistic calculation. Hence without adding new trainable parameters, using multiple-layer or multi-iteration information, or introducing extra computation, Batch Group Normalization (BGN) is proposed to solve the noisy/confused statistic calculation of BN at small/extreme large batch sizes with introducing the channel, height and width dimension to compensate. The group technique in Group Normalization (GN) is used and a hyper-parameter G is used to control the number of feature instances used for statistic calculation, hence to offer neither noisy nor confused statistic for different batch sizes. We empirically demonstrate that BGN consistently outperforms BN, Instance Normalization (IN), Layer Normalization (LN), GN, and Positional Normalization (PN), across a wide spectrum of vision tasks, including image classification, Neural Architecture Search (NAS), adversarial learning, Few Shot Learning (FSL) and Unsupervised Domain Adaptation (UDA), indicating its good performance, robust stability to batch size and wide generalizability. For example, for training ResNet-50 on ImageNet with a batch size of 2, BN achieves Top1 accuracy of 66.512% while BGN achieves 76.096% with notable improvement.

研究の動機と目的

  • バッチサイズが小さく、あるいは極めて大きな場合に、統計推定がノイズが多くなり混同するため、バッチ正規化(BN)の性能低下を是正すること。
  • GN、IN、LN、PN などの既存の正規化手法が、多様なビジョンタスクにわたる耐性や汎用性に欠けるという限界を克服すること。
  • 追加のトレーニング可能なパラメータや複数層の情報が不要な、パラメータおよび計算効率の高い正規化手法を提案し、さまざまなバッチサイズで高い性能を維持すること。
  • 画像分類、少サンプル学習、教師なしドメイン適応を含む複数のビジョンベンチマークで一貫した性能向上を達成すること。

提案手法

  • チャネル、高さ、幅の次元を一つの次元に統合し、G 個のグループに分割することで、グループベースの統計計算を導入する。
  • ミニバッチ全体および各グループ内で統計(平均と分散)を計算し、単一または極めて大きなグループからのノイズの多い推定を回避する。
  • 統計に使用する特徴インスタンス数を制御するハイパーパramータ G を用い、さまざまなバッチサイズに適応可能な耐性を実現する。
  • BN と同一の再パラメータ化(スケーリングとシフト)を維持することで、標準的なディープラーニングアーキテクチャとの互換性を確保する。
  • 各特徴グループごとに正規化処理を適用し、表現力は保持しつつ、学習の安定性を高める。
  • アーキテクチャや学習手順の変更なしに、BGN を既存モデルにおける BN の即時置換として統合可能である。

実験結果

リサーチクエスチョン

  • RQ1なぜバッチ正規化(BN)は小規模および極めて大規模なバッチサイズで性能が低下するのか?
  • RQ2追加のトレーニング可能なパラメータや追加計算が不要な条件下で、統計推定プロセスの見直しによって BN の性能低下を是正できるか?
  • RQ3チャネル、高さ、幅の次元にわたる特徴インスタンスのグループ化が、正規化層における統計推定をどのように改善するのか?
  • RQ4提案されたバッチグループ正規化(BGN)は、多様なビジョンタスクおよびバッチサイズにおいて、BN、GN、IN、LN、PN よりも汎用性に優れているか?
  • RQ5BGN は、データが少ない状況(例:少サンプル学習)やドメイン適応の場面で優れた性能を発揮できるか?

主な発見

  • バッチサイズが 2 の条件下で、ImageNet における BGN の Top-1 精度は 76.096% に達し、同じ条件下で BN が達成した 66.512% より顕著に優れている。
  • 5 ワイ 1 ショット設定の mini-ImageNet における少サンプル学習では、BGN は平均精度 59.50% を達成し、BN(59.30%)、IN(52.17%)、GN(56.55%)を上回った。
  • 5 ワイ 5 ショット少サンプル学習では、BGN は 76.32% の精度を達成し、BN(76.22%)、IN(70.49%)、GN(73.20%)を上回った。
  • Office-31 における教師なしドメイン適応では、BGN は平均精度 90.9% を達成し、BN(90.1%)、GN(88.6%)および他のベースラインを上回った。wa タスクでは 1.5% の改善を示した。
  • BGN は、画像分類、NAS、 adversarial 学習、少サンプル学習、ドメイン適応を含むすべての評価タスクで一貫した性能向上を示し、強力な汎用性を示している。
  • BGN は、小規模および極めて大規模なバッチサイズの両方で高い性能を維持しており、追加のパラメータや計算が不要な状態で、BN の飽和および性能低下問題を解消している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。