Skip to main content
QUICK REVIEW

[論文レビュー] Channel Equilibrium Networks for Learning Deep Representation

Wenqi Shao, Shitao Tang|arXiv (Cornell University)|Feb 29, 2020
Domain Adaptation and Few-Shot Learning参考文献 39被引用数 5
ひとこと要約

本稿では、一般化性能を損なう小さな活性化を持つ「抑制されたチャネル」を低減することで、畳み込み層内のすべてのチャネルが等しく寄与するよう強制する、新しいニューラルビルディングブロックであるチャネル均衡(CE)を提案する。CEは、双線形分解ブランチによる学習可能な非相関化機構と、インスタンスごとの再重み付けブランチを統合し、計算コストの増加を最小限に抑えつつImageNetおよびCOCOベンチマークで一般化性能を向上させ、ResNetおよびMobileNetの変種において最先端の性能を達成する。

ABSTRACT

Convolutional Neural Networks (CNNs) are typically constructed by stacking multiple building blocks, each of which contains a normalization layer such as batch normalization (BN) and a rectified linear function such as ReLU. However, this work shows that the combination of normalization and rectified linear function leads to inhibited channels, which have small magnitude and contribute little to the learned feature representation, impeding the generalization ability of CNNs. Unlike prior arts that simply removed the inhibited channels, we propose to "wake them up" during training by designing a novel neural building block, termed Channel Equilibrium (CE) block, which enables channels at the same layer to contribute equally to the learned representation. We show that CE is able to prevent inhibited channels both empirically and theoretically. CE has several appealing benefits. (1) It can be integrated into many advanced CNN architectures such as ResNet and MobileNet, outperforming their original networks. (2) CE has an interesting connection with the Nash Equilibrium, a well-known solution of a non-cooperative game. (3) Extensive experiments show that CE achieves state-of-the-art performance on various challenging benchmarks such as ImageNet and COCO.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)における『抑制されたチャネル』の問題に対処すること。これは、多くの特徴チャネルが小さな値を示し、表現学習にほとんど寄与しない状況を指す。
  • 少数の活性なチャネルに依存するのではなく、すべてのチャネルが均等に寄与するようにすることで、モデルの一般化性能を向上させること。
  • ResNet や MobileNet などの既存アーキテクチャと互換性を持つ、即挿入可能なビルディングブロックを設計すること。
  • CE とゲーム理論におけるナッシュ均衡との間の理論的関連性を確立すること。
  • 画像分類、物体検出、インスタンスセグメンテーションを含む多様なタスクにおいて、CE の有効性を実証すること。

提案手法

  • CEは、正規化層(例:BN)と活性化関数(例:ReLU)の間に挿入され、標準的な正規化-活性化ブロックに置き換わる。
  • 双線形分解(BD)ブランチは、サンプル固有の非相関化演算子を計算し、特徴チャネル間の相関を低減する。
  • インスタンスごとの再重み付け(IR)ブランチは、チャネル応答の大きさに応じて適応的にスケーリングし、寄与のバランスを促進する。
  • CEブロックは、BDとIRの出力を、学習可能な変換を介して結合することで、動的でサンプル依存のチャネル均衡を実現する。
  • ブロックは標準的なバックプロパゲーションを用いてエンドツーエンドで学習され、BNのガンマおよびベータパラメータに加え、CEパラメータのみが更新される。
  • 本手法は、固定BNおよび同期BNの両設定と互換性があり、多様な学習環境への導入を可能にする。

実験結果

リサーチクエスチョン

  • RQ1学習可能なメカニズムが、深層CNNにおける抑制されたチャネルの数を削減し、一般化性能を向上させることができるか?
  • RQ2同じ層内でチャネルの寄与を均等化することにより、下流タスクでの性能向上が達成できるか?
  • RQ3CEメカニズムとゲーム理論におけるナッシュ均衡との間に理論的関連性があるか?
  • RQ4ResNet や MobileNet などの多様なアーキテクチャに、顕著な計算コスト増加なしにCEを効果的に統合できるか?
  • RQ5CEは画像分類を越えて、物体検出やインスタンスセグメンテーションといったタスクにも一般化できるか?

主な発見

  • CEは、BN や LN と比較して、抑制されたチャネル(特徴値 < 10⁻²)の数を顕著に削減し、特に深層ネットワークで顕著である。
  • CIFAR-10では、CEはテスト誤差を低減し、特定のチャネルへの依存度を低下させることでトップ1精度を向上させ、累積的アブレーション曲線でもその効果が示された。
  • ResNet50に適用した場合、CEはImageNet上でトップ1精度を1.7%向上させ、元のResNet50+BNを上回り、Squeeze-and-Excitationブロックでさえも凌駒した。
  • MobileNetv2では、ImageNet上でトップ1精度が2.1%向上し、アーキテクチャの種類を問わず優れた一般化性能を示した。
  • COCOでは、CE-ResNet50は物体検出でAPを2.2ポイント、インスタンスセグメンテーションで2.7ポイント向上させ、同期CEでは検出タスクで42.0 APを達成した。
  • CEブロックは、最小限の計算コストで複数のベンチマークで最先端の性能を達成し、多様なタスクおよびアーキテクチャで一貫した向上効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。