Skip to main content
QUICK REVIEW

[論文レビュー] The Shallow End: Empowering Shallower Deep-Convolutional Networks through Auxiliary Outputs

Yong Guo, Jian Chen|arXiv (Cornell University)|Nov 6, 2016
Advanced Neural Network Applications参考文献 58被引用数 8
ひとこと要約

本稿では、中間層に補助損失を追加し、各損失に対して別々の誤差逆伝播を実行することで、浅い深層畳み込みニューラルネットワークの性能を向上させるMulti-way Backpropagation (MW-BP) を提案する。訓練中の監視信号の消失を軽減することで、MW-BPは顕著にコンactなモデルを生成する—例えば、MwResNet-44 はパラメータ数が少なく、最先端のモデル圧縮技術を上回る精度でCIFAR-10およびCIFAR-100でResNet-110を上回る性能を発揮する。

ABSTRACT

Depth is one of the key factors behind the success of convolutional neural networks (CNNs). Since ResNet, we are able to train very deep CNNs as the gradient vanishing issue has been largely addressed by the introduction of skip connections. However, we observe that, when the depth is very large, the intermediate layers (especially shallow layers) may fail to receive sufficient supervision from the loss due to the severe transformation through a long backpropagation path. As a result, the representation power of intermediate layers can be very weak and the model becomes very redundant with limited performance. In this paper, we first investigate the supervision vanishing issue in existing backpropagation (BP) methods. And then, we propose to address it via an effective method, called Multi-way BP (MW-BP), which relies on multiple auxiliary losses added to the intermediate layers of the network. The proposed MW-BP method can be applied to most deep architectures with slight modifications, such as ResNet and MobileNet. Our method often gives rise to much more compact models (denoted by "Mw+Architecture") than existing methods. For example, MwResNet-44 with 44 layers performs better than ResNet-110 with 110 layers on CIFAR-10 and CIFAR-100. More critically, the resultant models even outperform the light models obtained by state-of-the-art model compression methods. Last, our method inherently produces multiple compact models with different depths at the same time, which is helpful for model selection.

研究の動機と目的

  • 標準的な誤差逆伝播による非常に深いCNNで、中間層が長い逆伝播パスのため、勾配信号が不十分に到達するという監視信号の消失問題を調査すること。
  • アーキテクチャの効率性にもかかわらず、高いパラメータ数、大きなモデルサイズ、および高い推論コストを引き起こす深層ネットワークのモデル冗長性を解消すること。
  • 訓練中に中間層の表現力の向上を図るため、より強く直接的な監視を提供する補助損失を導入すること。
  • 1つのアーキテクチャから複数の異なる深さのコンパクトモデルを同時にトレーニングできるフレームワークを開発すること。
  • より少ないパラメータ数と低い推論コストで、既存のモデル圧縮手法を上回る精度を達成すること。

提案手法

  • 補助損失ごとに別々の誤差逆伝播を実行することで、中間層に異なる勾配信号を保持する、1回の順方向伝播と複数回の独立した誤差逆伝播を実行するMulti-way Backpropagation (MW-BP) を提案する。
  • 訓練中に異なる監視信号からの勾配の衝突を軽減するため、補助損失に適応的重み付け方式を導入する。
  • ResNet、MobileNet、DenseNet、Inception などの深層アーキテクチャに、最小限のアーキテクチャ変更で複数の中間層に補助出力を適用する。
  • 学習率の減少に応じて損失重みを調整する動的重み付け戦略(Adaptive-I および Adaptive-II)を採用し、訓練の安定性と中間モデルの性能を向上させる。
  • すべての損失に対して共通の順方向伝播を用いることで、計算効率を維持しながら、各損失ごとに独立した勾配更新を可能にする。
  • 同じトレーニングプロセスから、異なる補助損失に対応する複数のコンパクトモデルを抽出することで、モデル選択を可能にする。

実験結果

リサーチクエスチョン

  • RQ1標準的な誤差逆伝播でトレーニングされる非常に深いCNNにおいて、監視信号の消失は中間層の表現能力にどのように影響するか?
  • RQ2アーキテクチャの再設計なしに、補助損失を用いることで、深層ネットワークのモデル冗長性を顕著に低減し、性能を向上させることができるか?
  • RQ3複数の補助損失を誤差逆伝播で組み合わせる最適な戦略は何か?勾配の衝突を回避し、学習収束を改善するには?
  • RQ4MW-BPは、より深い標準モデルや最先端の圧縮モデルを上回る精度と効率を達成するコンパクトモデルを生成できるか?
  • RQ5MW-BPは、1回のトレーニングランから、異なる深さの複数のコンパクトモデルを同時に生成できるか、その程度はどの程度か?

主な発見

  • 44層のMwResNet-44は、CIFAR-10で5.67%の誤差、CIFAR-100で27.35%の誤差を達成し、170万パラメータのResNet-110(110層)を上回る性能を発揮する。
  • MwResNet-56-5(モデル-45)の中間モデルは、0.85MパラメータでCIFAR-10およびCIFAR-100の両方でResNet-110を上回る性能を達成する。
  • 最大5つの補助損失を追加すると最適な性能が得られるが、10個や25個と過剰に追加すると干渉が生じ、学習が遅くなり性能が低下する。
  • 適応的重み付け戦略(Adaptive-I および Adaptive-II)は、固定重み付けよりも中間モデルの性能を向上させるが、特に初期段階のモデルで顕著である。
  • 5つの補助損失を用いたMwResNet-56-5は、CIFAR-10で5.53%の誤差を達成し、標準のResNet-56(6.08%)および2つの損失を用いたMwResNet-56(5.77%)を顕著に上回る。
  • 提案手法は、モデルサイズが小さく、推論コストが低い一方で、最先端のモデル圧縮技術を上回る精度を達成するモデルを生成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。