[論文レビュー] Learning Strict Identity Mappings in Deep Residual Networks
この論文では、残差応答がしきい値 $\epsilon$ 未満に下がった場合に厳密な恒等マッピングを強制することで、深層残差ネットワーク内の冗長な残差ブロックを自動でプルーニングする方法である $\epsilon$-ResNet を提案する。わずかな追加の ReLU ユニットを用いることで、性能損ないなしにトレーニング中にレイヤープルーニングを可能にし、CIFAR および SVHN データセットでは最大 80% のパラメータ削減を達成し、ImageNet では最小限の精度低下で 36% のプルーニングを実現した。
A family of super deep networks, referred to as residual networks or ResNet, achieved record-beating performance in various visual tasks such as image recognition, object detection, and semantic segmentation. The ability to train very deep networks naturally pushed the researchers to use enormous resources to achieve the best performance. Consequently, in many applications super deep residual networks were employed for just a marginal improvement in performance. In this paper, we propose epsilon-ResNet that allows us to automatically discard redundant layers, which produces responses that are smaller than a threshold epsilon, with a marginal or no loss in performance. The epsilon-ResNet architecture can be achieved using a few additional rectified linear units in the original ResNet. Our method does not use any additional variables nor numerous trials like other hyper-parameter optimization techniques. The layer selection is achieved using a single training process and the evaluation is performed on CIFAR-10, CIFAR-100, SVHN, and ImageNet datasets. In some instances, we achieve about 80% reduction in the number of parameters.
研究の動機と目的
- 高い計算コストに対してわずかな性能向上しか得られない、極めて深層化した残差ネットワークの非効率性を解消すること。
- 再トレーニングやハイパーパramータチューニングを必要とせず、残差ネットワーク内の冗長なレイヤーを自動で特定・削除する手法を開発すること。
- 出力がしきい値 $\epsilon$ 未満である残差ブロックに対して、動的に恒等マッピングを強制することで、残差ネットワークにおける厳密な恒等マッピングを実現すること。
- 複数のベンチマークデータセットで、顕著なモデル圧縮を実現しつつ、性能劣化を最小限に抑えること。
提案手法
- すべての応答が $\epsilon$ 未満の場合に残差出力をゼロに設定するスパーシファイア関数 $\mathcal{S}(\mathcal{F}(x))$ を導入し、それ以外の場合は $\mathcal{F}(x)$ をそのままで出力する。
- スパーシファイア関数を実装するために、標準の残差ブロックに追加の ReLU ユニットを追加し、エンドツーエンドのトレーニングと自動レイヤープルーニングを可能にする。
- 各レイヤー削除後に学習率をリセットする適応的学習率スケジューリングを用いた単一のトレーニングプロセスを採用し、最適化の安定化を図る。
- ネットワークの中間層に係数 0.1 のサイドサブジェンスを適用し、重み減衰を促進し、プルーニングの安定性を向上させる。
- すべてのデータセットで標準的なデータオーグメンテーションおよび SGD を用い、バッチ正則化、重み減衰、モーメンタムを併用する。
- CIFAR-10、CIFAR-100、SVHN、ImageNet でトレーニングを行い、各レイヤー削除後に学習率を加速して減少させる変更を加えた学習率スケジュールを適用する。
実験結果
リサーチクエスチョン
- RQ1深層残差ネットワークにおける冗長な残差ブロックを、性能劣化を最小限に抑えつつ自動で特定・プルーニングできるか?
- RQ2残差応答にしきい値 $\epsilon$ を用いた厳密な恒等マッピングを強制することで、効果的かつ安定したモデル圧縮が達成できるか?
- RQ3追加のハイパーパramータチューニングや複数回の再トレーニングを必要とせず、1回のトレーニングランでプルーニングプロセスを実現できるか?
- RQ4プルーニングされたレイヤーの分布はネットワークの深さに応じてどのように変化するか?また、プルーニングはより深い層に偏る傾向があるか?
- RQ5標準的なビジョンベンチマークで競争力のある精度を維持しつつ、どの程度モデルサイズを縮小できるか?
主な発見
- CIFAR-100 において、$\epsilon$-ResNet は 3.2 倍の圧縮比(752 レイヤーが約 235 レイヤーに削減)を達成し、バリデーション誤差は 24.8% から 23.8% に低下した。
- CIFAR-10、CIFAR-100、SVHN において、$\epsilon$-ResNet は元の ResNet と比較して性能に劣化なしに最大 80% のパラメータ削減を達成した。
- ImageNet において、101 レイヤーおよび 152 レイヤーの $\epsilon$-ResNet は 20.12% から 36.23% のレイヤープルーニングを達成し、精度低下は最小限に抑えられた。
- トレーニング中に厳密な恒等マッピングの割合が増加し、最終的にフルネットワークの性能と一致する水準に安定した。
- プルーニングはより深い層でより積極的であり、出力に近い部分でより多くのブロックが破棄された。これは、より重要なコンポONENTを保持し、あまり重要でない部分を優先的に削除する傾向があることを示している。
- サイドサブジェンスは重み減衰とプルーニングの安定性を向上させたが、$\epsilon$-ResNet は性能損ないなしに標準 ResNet よりも圧縮効率が優れていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。