Skip to main content
QUICK REVIEW

[論文レビュー] VACL: Variance-Aware Cross-Layer Regularization for Pruning Deep Residual Networks

Shuang Gao, Xin Liu|arXiv (Cornell University)|Sep 10, 2019
Advanced Neural Network Applications参考文献 39被引用数 4
ひとこと要約

本稿では、スキップ接続層を貫通するフィルタをグループ化し、層間重み分散を最小化することで構造的スパarsityを強制する、分散に配慮したクロスレイヤー正則化手法VACLを提案する。CIFAR-10におけるResNet110では、精度に影響を与えずに最大79.5%のパラメータ削減を達成し、ImageNetでは63.3%の pruning 率を達成しながらトップ5精度が1%未満低下する。これは最先端手法を上回る性能を示している。

ABSTRACT

Improving weight sparsity is a common strategy for producing light-weight deep neural networks. However, pruning models with residual learning is more challenging. In this paper, we introduce Variance-Aware Cross-Layer (VACL), a novel approach to address this problem. VACL consists of two parts, a Cross-Layer grouping and a Variance Aware regularization. In Cross-Layer grouping the $i^{th}$ filters of layers connected by skip-connections are grouped into one regularization group. Then, the Variance-Aware regularization term takes into account both the first and second-order statistics of the connected layers to constrain the variance within a group. Our approach can effectively improve the structural sparsity of residual models. For CIFAR10, the proposed method reduces a ResNet model by up to 79.5% with no accuracy drop and reduces a ResNeXt model by up to 82% with less than 1% accuracy drop. For ImageNet, it yields a pruned ratio of up to 63.3% with less than 1% top-5 accuracy drop. Our experimental results show that the proposed approach significantly outperforms other state-of-the-art methods in terms of overall model size and accuracy.

研究の動機と目的

  • スキップ接続を有する深層残差ネットワークの pruning において、スパースネスパターンの不整合が効率を低下させることに起因する課題に対処すること。
  • スキップ接続によって接続された層間の重み分散を低減させることで、効果的な pruning を妨げる要因を軽減すること。
  • 残差ブロック全体にわたるチャネル整合スパースネスを強制することで、構造的スパースネスを向上させること。
  • グループ化された層内の重みの一次および二次の統計量を活用する正則化手法を開発すること。
  • VACLで訓練された pruning モデルが、シーン認識などの下流タスクに良好に一般化できることを示すこと。

提案手法

  • VACLは、スキップ接続によって接続されたすべての層のi番目のフィルタを、1つの正則化グループにクラスタリングすることでクロスレイヤーのグループ化を実現する。
  • 各グループ内の重みの平均と分散を考慮する分散に配慮した正則化項を適用し、マグニチュードの差を最小化する。
  • 正則化項は、接続された層間で類似したマグニチュードを促進するように設計されており、重みをゼロに設定する際の高いパrameter分散のリスクを低減する。
  • 訓練と pruning を組み合わせたパイプラインに統合され、正則化項によって訓練中にスパースネスが誘導される。
  • 学習可能なハイパーパramータλを用いたグループ Lasso スタイルの正則化を採用し、スパースネス誘導の強度を制御する。
  • 事前学習モデルからの微調整と、ランダム初期化からの訓練の両方をサポートし、競争力のある性能を発揮する。

実験結果

リサーチクエスチョン

  • RQ1クロスレイヤー正則化により、スキップ接続された層間でスパースネスパターンを整列させることで、残差ネットワークにおける構造的スパースネスが向上するか?
  • RQ2標準的な L1 やグループ Lasso 正則化と比較して、重みの一次および二次の統計量を考慮することで、pruning 性能がどのように向上するか?
  • RQ3VACL を深層残差アーキテクチャ(例:ResNet や ResNeXt)に適用することで、精度の低下を最小限に抑えつつ効果的な pruning が可能か?
  • RQ4VACL を用いて pruning されたモデルは、インDoor-67 データセットにおけるシーン認識タスクなど、転移学習タスクに良好に一般化できるか?
  • RQ5VACL を用いてランダム初期化からモデルを訓練することは可能か?また、標準的な train-prune-fine-tune パラダイムと比較して性能はいかがなっているか?

主な発見

  • CIFAR-10 において、VACL は ResNet110 のモデルサイズを79.5%削減し、精度に影響を与えず、トップ1誤差は22.85%を達成した。
  • CIFAR-10 における ResNeXt-29-8-64 では、82%のパラメータ削減を達成し、精度低下は1%未満であった。
  • ImageNet では、ResNet50 に対して63.3%の pruning 確率を達成し、トップ5精度は0.94%低下した。トップ1精度は1.61%低下した。
  • 本手法は、ThiNet-70 や ThiNet-50 といった最先端手法と比較して、モデルのコンパクトさと精度のトレードオフにおいて優れている。
  • VACL で訓練されたモデルは良好な一般化性能を示し、インDoor-67 シーン認識データセットで70.1%の精度を達成し、パラメータ数はたった610万にとどまった。
  • ランダム初期化からの VACL による訓練は、微調整と同等の精度を達成でき、実行間で最大0.16%の差異しか示さなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。