Skip to main content
QUICK REVIEW

[論文レビュー] SSN: Learning Sparse Switchable Normalization via SparsestMax

Wenqi Shao, Tianjian Meng|arXiv (Cornell University)|Mar 9, 2019
Advanced Neural Network Applications参考文献 34被引用数 8
ひとこと要約

この論文は、SparsestMaxと呼ばれる新しい微分可能スパース誘導関数を用いて、各レイヤーで1つの正規化手法(例:BN、IN、LN)を選択するSparse Switchable Normalization(SSN)を提案する。これにより、パフォーマンスを損なわずに高速な推論が可能となる。SSNは、Switchable Normalizationのソフトで密なアテンションを、スパースでワンホットな選択メカニズムに置き換えることで、ImageNet、Cityscapes、ADE20K、Kineticsベンチマークで最先端または競争力のある結果を達成する。

ABSTRACT

Normalization methods improve both optimization and generalization of ConvNets. To further boost performance, the recently-proposed switchable normalization (SN) provides a new perspective for deep learning: it learns to select different normalizers for different convolution layers of a ConvNet. However, SN uses softmax function to learn importance ratios to combine normalizers, leading to redundant computations compared to a single normalizer. This work addresses this issue by presenting Sparse Switchable Normalization (SSN) where the importance ratios are constrained to be sparse. Unlike $\ell_1$ and $\ell_0$ constraints that impose difficulties in optimization, we turn this constrained optimization problem into feed-forward computation by proposing SparsestMax, which is a sparse version of softmax. SSN has several appealing properties. (1) It inherits all benefits from SN such as applicability in various tasks and robustness to a wide range of batch sizes. (2) It is guaranteed to select only one normalizer for each normalization layer, avoiding redundant computations. (3) SSN can be transferred to various tasks in an end-to-end manner. Extensive experiments show that SSN outperforms its counterparts on various challenging benchmarks such as ImageNet, Cityscapes, ADE20K, and Kinetics.

研究の動機と目的

  • スイッチャブル正規化(SN)が各レイヤーで複数の正規化手法をソフトアテンションで組み合わせるための計算非効率性を解消すること。
  • 非微分可能なℓ₀またはℓ₁正則化に依存せずに、スパースな正規化手法選択をエンドツーエンドで学習可能にするための手法。
  • 正規化手法のワンホット選択を保証する微分可能でフォワードパス可能なスパース誘導関数を設計すること。
  • スパースな正規化手法選択が、多様な視覚タスクにおいて推論速度を向上させつつ、精度を維持または向上させることを実証すること。

提案手法

  • 入力をL1球に射影することでワンホット出力を強制する、スパースなソフトマックスの拡張版であるSparsestMaxを提案。これにより、各レイヤーで正確に1つの正規化手法が選択される。
  • 各正規化レイヤーがBN、IN、LNの統計量の重み付き平均を計算するが、その重みはSparsestMaxによってスパースに制約される。
  • 選択を制御する学習可能なパラメータzを用い、p = SparsestMax(z)により、1つのレイヤーで3つの正規化手法のうち1つだけが活性化されることを保証する。
  • 反復的最適化を回避する幾何的射影アプローチを用いてSparsestMaxを計算する。入力ベクトルをL1球に射影することでスパース性を強制する。
  • バックプロパゲーションを用いてエンドツーエンドでモデルを学習し、SparsestMaxを標準的なディープラーニングフレームワークと互換性のある微分可能レイヤーとして統合する。
  • ResNetやI3Dなどのさまざまなアーキテクチャと、ImageNetの事前学習を用いた標準的な訓練プロトコルで、分類、セマンティックセグメンテーション、アクション認識などのタスクにSSNを適用する。

実験結果

リサーチクエスチョン

  • RQ1非微分可能な正則化に依存せずに、スパースな正規化手法選択を実現する微分可能でフォワードパス可能なメカニズムを設計できるか?
  • RQ2複数の正規化手法を組み合わせるのではなく、各レイヤーで1つの正規化手法を選択することで、推論速度が向上し、モデル精度を維持または向上させられるか?
  • RQ3さまざまなバッチサイズを想定した多様なコンピュータビジョンベンチマーク(ImageNet、Cityscapes、ADE20K、Kinetics)において、SSNの性能はSN、BN、GN、SyncBNと比べてどうなるか?
  • RQ4SparsestMaxは、深層学習アーキテクチャにおけるワンホット分布の学習に一般化可能な微分可能レイヤーとして利用可能か?

主な発見

  • ADE20Kの検証セットではSSNが39.3%のmIoUを達成し、SyncBN(37.7%)やGN(36.3%)を上回り、SN(39.1%)と同等の精度を維持しながら推論効率が向上した。
  • CityscapesではSSNが75.7%のmIoUを達成し、SN(75.8%)と同等であり、SyncBN(72.7%)やGN(72.2%)を大きく上回った。
  • Kineticsのアクション認識タスクでは、バッチサイズ8でSSNが73.8%のトップ1精度を達成し、SN(73.5%)やBN(73.3%)を上回り、小バッチサイズでも安定性を示した。
  • SparsestMaxを用いたSSNは、ハイパーパramータチューニングなしでスパースな正規化手法選択のエンドツーエンド学習を可能にし、標準的なディープラーニングフレームワークと互換性を保った。
  • アブレーションスタディにより、SSNのスパース選択機構が余分な計算を回避し、SNに比べてより高速な推論を実現することが確認された。
  • SSNはタスクに広く一般化可能である:画像分類(ImageNet)、セマンティックセグメンテーション(Cityscapes、ADE20K)、アクション認識(Kinetics)の各タスクで性能向上を示し、広範な適用可能性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。