Skip to main content
QUICK REVIEW

[論文レビュー] Layer Pruning via Fusible Residual Convolutional Block for Deep Neural Networks

Pengtao Xu, Jian Cao|arXiv (Cornell University)|Nov 29, 2020
Advanced Neural Network Applications参考文献 31被引用数 14
ひとこと要約

本稿では、トレーニング中に全ネットワーク層の自動的・構造的な削除を可能にする、融合可能な残差畳み込みブロック(ResConv)を用いた新しいレイヤープルーニング手法を提案する。L1正則化を施したトレーナブルなスケーリングファクターを導入することで、重要でないレイヤーを特定・削除し、精度の低下を最小限に抑えつつ高い圧縮率と高速化を達成する。例として、CIFAR-10でResNet-110を用いた場合、FLOPsが65.5%削減され、パラメータが55.5%削減され、トップ1精度はたった0.13%の低下にとどまる。

ABSTRACT

In order to deploy deep convolutional neural networks (CNNs) on resource-limited devices, many model pruning methods for filters and weights have been developed, while only a few to layer pruning. However, compared with filter pruning and weight pruning, the compact model obtained by layer pruning has less inference time and run-time memory usage when the same FLOPs and number of parameters are pruned because of less data moving in memory. In this paper, we propose a simple layer pruning method using fusible residual convolutional block (ResConv), which is implemented by inserting shortcut connection with a trainable information control parameter into a single convolutional layer. Using ResConv structures in training can improve network accuracy and train deep plain networks, and adds no additional computation during inference process because ResConv is fused to be an ordinary convolutional layer after training. For layer pruning, we convert convolutional layers of network into ResConv with a layer scaling factor. In the training process, the L1 regularization is adopted to make the scaling factors sparse, so that unimportant layers are automatically identified and then removed, resulting in a model of layer reduction. Our pruning method achieves excellent performance of compression and acceleration over the state-of-the-arts on different datasets, and needs no retraining in the case of low pruning rate. For example, with ResNet-110, we achieve a 65.5%-FLOPs reduction by removing 55.5% of the parameters, with only a small loss of 0.13% in top-1 accuracy on CIFAR-10.

研究の動機と目的

  • 推論効率とメモリ使用量の面で利点があるものの、効果的なレイヤープルーニング手法の不足に取り組む。
  • トレーニング中に全畳み込みレイヤーを構造的に自動的に削除できる手法を開発する。
  • リソース制限のあるデバイス上で高いモデル圧縮率と高速化を達成しながら、精度の低下を最小限に抑える。
  • トレーニング後、ResConv構造を標準畳み込みに統合することで、推論時に計算オーバーヘッドを追加せずに効率を向上させる。
  • 低プルーニング率でのプルーニング後、再訓練を必要とせず最先端のモデル圧縮性能を達成する。

提案手法

  • 1つの畳み込みレイヤーにトレーナブルなスケーリングファクターとショートカット接続を組み込んだ、融合可能な残差畳み込みブロック(ResConv)を導入する。
  • 各畳み込みレイヤーの寄与度を制御するレイヤースケーリングファクターを用い、スパarsityを介した構造的プルーニングを可能にする。
  • トレーニング中にスケーリングファクターにL1正則化を適用し、スパarsityを誘発し、重要でないレイヤーを特定する。
  • ResConvブロックを用いてネットワークをトレーニングすることで、精度を維持しつつ、深層プレーンネットワークの学習を可能にする。
  • トレーニング後、スケーリングファクターを吸収することで、ResConv構造を標準畳み込みレイヤーに統合し、推論時のオーバーヘッドを排除する。
  • スケーリングファクターの値が0またはほぼ0のレイヤーを削除することで、コンactで効率的なモデルを実現する。

実験結果

リサーチクエスチョン

  • RQ1残差ブロック構造内にトレーナブルなスケーリングファクターを導入することで、精度を損なわず自動的かつ構造的なレイヤープルーニングが可能になるか?
  • RQ2提案手法は、画像分類ベンチマークで高い精度を維持しつつ、FLOPsとパラメータをどれほど削減できるか?
  • RQ3特に低プルーニング率において、精度の低下を最小限に抑えながら高い圧縮率と高速化を達成できるか?
  • RQ4統合されたResConv構造は、推論時に計算コストを追加せずにシームレスに統合可能か?
  • RQ5フィルターや重みのプルーニング技術と比較して、推論効率とモデルのコンパクトさの面で優れているか?

主な発見

  • 提案手法は、CIFAR-10でResNet-110を用いた場合、FLOPsが65.5%削減され、パラメータが55.5%削減され、トップ1精度はたった0.13%の低下にとどまる。
  • 本手法は、プルーニング後、再訓練を必要とせず、低プルーニング率であっても高い圧縮率と高速化を達成できる。
  • 統合されたResConv構造は、トレーニング後に標準畳み込みレイヤーに統合されるため、推論時に計算オーバーヘッドを追加しない。
  • スケーリングファクターにL1正則化を適用することで、スパarsityが効果的に誘発され、重要でないレイヤーの自動特定・削除が可能になる。
  • データ移動の削減により、既存のフィルターや重みのプルーニング技術と比較して、推論効率とメモリ使用量の面で優れた性能を発揮する。
  • 本手法は、チャネルレベルおよびレイヤー単位の構造的プルーニングを可能にしつつ、高い精度を維持するため、リソース制限のあるデバイスへのデプロイに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。