Skip to main content
QUICK REVIEW

[論文レビュー] Switchable Normalization for Learning-to-Normalize Deep Representation

Ping Luo, Ruimao Zhang|arXiv (Cornell University)|Jul 22, 2019
Domain Adaptation and Few-Shot Learning被引用数 8
ひとこと要約

本稿では、各層ごとに学習可能な重みを用いてバッチ正規化(BN)、レイヤー正規化(LN)、インスタンス正規化(IN)の統計を動的に選択する、学習可能な正規化手法「スイッチャブル正規化(SN)」を提案する。SNは、画像分類、物体検出、セマンティックセグメンテーション、顔認識、スタイル変換といった多様なタスクにおいて、各層に適した正規化戦略を適用することで性能を向上させ、BN、GN、INを上回り、特に小バッチサイズ下でも顕著な性能向上を示し、ハイパーパramータの感度を解消する。

ABSTRACT

We address a learning-to-normalize problem by proposing Switchable Normalization (SN), which learns to select different normalizers for different normalization layers of a deep neural network. SN employs three distinct scopes to compute statistics (means and variances) including a channel, a layer, and a minibatch. SN switches between them by learning their importance weights in an end-to-end manner. It has several good properties. First, it adapts to various network architectures and tasks. Second, it is robust to a wide range of batch sizes, maintaining high performance even when small minibatch is presented (e.g. 2 images/GPU). Third, SN does not have sensitive hyper-parameter, unlike group normalization that searches the number of groups as a hyper-parameter. Without bells and whistles, SN outperforms its counterparts on various challenging benchmarks, such as ImageNet, COCO, CityScapes, ADE20K, MegaFace, and Kinetics. Analyses of SN are also presented to answer the following three questions: (a) Is it useful to allow each normalization layer to select its own normalizer? (b) What impacts the choices of normalizers? (c) Do different tasks and datasets prefer different normalizers? We hope SN will help ease the usage and understand the normalization techniques in deep learning. The code of SN has been released at https://github.com/switchablenorms.

研究の動機と目的

  • 深層ネットワーク全体で同一の正規化タイプを使用する場合の性能劣化を是正すること。
  • グループ正規化におけるグループ数などの手動ハイパーパramータチューニングの必要性を排除すること。
  • 各層ごとに正規化選択を適応的に行えるようにし、多様なアーキテクチャーやタスクにおける汎化性能と性能を向上させること。
  • 各層ごとに正規化タイプを最適選択することで性能が向上するか、およびその選択に影響を与える要因(アーキテクチャ、タスク、データ分布など)を分析すること。

提案手法

  • SNは、ミニバッチ、チャネル、空間次元ごとにそれぞれバッチ正規化(BN)、レイヤー正規化(LN)、インスタンス正規化(IN)の統計を組み合わせ、それぞれの平均と分散を計算する。
  • 微分可能なゲーティング機構を用いて、各正規化タイプの重要度重みを学習し、選択プロセスをエンドツーエンドで訓練可能にする。
  • 最終的な正規化出力は、3つの正規化特徴量の重み付き和であり、重みはチャネル間で共有されるが、各層ごとに別々に学習される。
  • 本手法はCNNおよびRNN(LSTMを含む)に適用可能で、計算オーバーヘッドを最小限に抑えながら、トレーニングと推論の両方に対応する。
  • 推論コストを削減するため、ハードルーティング(例:各層で1つの正規化手法のみを選択)も検討され、スパarsなSNでは50%の層がBNを選択しており、線形層への変換が可能である。
  • 特に分散学習環境下での汎化性能向上を図るため、SNに同期バッチ正規化を適用する。

実験結果

リサーチクエスチョン

  • RQ1ネットワーク全体で固定の正規化手法を使用するのではなく、各正規化層が自らの正規化手法を独立に選択できるようにすることが有益であるか?
  • RQ2各層での正規化手法選択に影響を与える要因は何か—アーキテクチャ、タスク、データ分布、それとも他の要因か?
  • RQ3異なるタスクやデータセットでは、正規化手法の異なる組み合わせが好まれるか?
  • RQ4小バッチサイズ下では、BNが性能を著しく低下させるが、SNはそのような状況下でも性能を発揮するか?
  • RQ5SNはCNNおよびRNN(LSTMを含む)の両方、特にアーキテクチャ探索の文脈でも有効に使用できるか?

主な発見

  • ResNet50を用いたImageNet実験では、バッチサイズ(1,4)条件下でSNがトップ-1正確度76.9%を達成し、BN(76.4%)とGN(75.9%)を上回り、理想的なBN性能に近づいた。
  • 非常に小さなバッチサイズ(例:1GPUあたり2画像)でもSNは高い正確度を維持したが、BNとGNは著しく性能を低下させた。
  • VGG16を用いたスタイル変換タスクでは、SNはINとBNの両方よりも収束が速く、自動的にINを主な正規化手法として選択し、このタスクにおけるINの好まれる傾向と一致した。
  • LSTMコントローラーを用いたニューラルアーキテクチャ探索では、SNはLNとGNを上回り、CIFAR-10でのバリデーション正確度が向上した。これは、探索ポリシー学習において優れた性能を示した。
  • SN層の直後に小スコールドアウト(0.1–0.2)を組み合わせた場合、過学習が軽減され、ImageNetにおける汎化性能が向上した。
  • ハードルーティングを適用したSNでは、スパース構成下で推論時間が50%短縮され、50%の層がBNを選択したため、線形変換による効率的なデプロイメントが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。