Skip to main content
QUICK REVIEW

[論文レビュー] DropNet: Reducing Neural Network Complexity via Iterative Pruning

John Tan Chong Min, Mehul Motani|arXiv (Cornell University)|Jul 14, 2022
Advanced Neural Network Applications被引用数 5
ひとこと要約

DropNetは、すべての訓練サンプルにわたる平均出力活性化値が最も低いノード/フィルタを恒久的に削除することで、ニューラルネットワークの複雑さを低減する反復的プルーニング手法である。MLPおよびCNNにおいて最大90%のパラメータ削減を達成し、精度の低下を最小限に抑え、特化した重み初期化を必要とせずに、オーラクルプルーニング手法と同等の性能を発揮する。

ABSTRACT

Modern deep neural networks require a significant amount of computing time and power to train and deploy, which limits their usage on edge devices. Inspired by the iterative weight pruning in the Lottery Ticket Hypothesis, we propose DropNet, an iterative pruning method which prunes nodes/filters to reduce network complexity. DropNet iteratively removes nodes/filters with the lowest average post-activation value across all training samples. Empirically, we show that DropNet is robust across diverse scenarios, including MLPs and CNNs using the MNIST, CIFAR-10 and Tiny ImageNet datasets. We show that up to 90% of the nodes/filters can be removed without any significant loss of accuracy. The final pruned network performs well even with reinitialization of the weights and biases. DropNet also has similar accuracy to an oracle which greedily removes nodes/filters one at a time to minimise training loss, highlighting its effectiveness.

研究の動機と目的

  • エッジデバイスへのディープニューラルネットワークのデプロイのための計算およびメモリのオーバーヘッドを低減すること。
  • 全結合層および畳み込み層の両方で動作する、ロバストでデータ駆動型のプルーニング手法を開発すること。
  • プルーニングされたモデルにおいて、ロットリート・チケット風の再初期化を含む特別な重み初期化を必要としないようにすること。
  • プルーニング中に訓練損失を貪欲に最小化するオーラクル手法と同等のプルーニング性能を達成すること。
  • 標準的な機械学習ライブラリおよびハードウェアを用いて、プルーニングモデルの実用的デプロイを可能にすること。

提案手法

  • DropNetは、すべての訓練サンプルにわたる平均出力活性化値が最も低いノード/フィルタを、グローバルまたはレイヤー単位で反復的に削除する。
  • プルーニングの意思決定は、バリデーションセットではなく、全訓練セットにわたる各ノード/フィルタの活性化マグニチュードの平均に基づく。
  • 各プルーニングステップの後、残存ネットワークは元のロットリート・チケット初期化ではなく、ランダムな重みとバイアスで再初期化される。
  • アルゴリズムは、プルーニング後のネットワークの訓練と、活性化統計に基づいた次回のノード/フィルタのプルーニング対象の特定を交互に繰り返す。
  • 2つのプルーニング指標が評価された:'minimum'(グローバルプルーニング)と'minimum_layer'(レイヤー単位プルーニング)、後者が深層モデルでより優れた性能を示した。
  • この手法は、MNIST、CIFAR-10、Tiny ImageNetの複数のデータセットに対して、全結合ネットワーク(MLPs)および畳み込みニューラルネットワーク(CNNs)に適用された。

実験結果

リサーチクエスチョン

  • RQ1平均出力活性化値に基づく反復的プルーニングは、ネットワークの複雑さを低減しつつ高い精度を達成できるか?
  • RQ2DropNetは、ロットリート・チケット風の重み再初期化を必要とせずに性能を維持できるか?
  • RQ3DropNetの性能は、訓練損失を貪欲に最小化するオーラクルプルーニング手法と比べてどうか?
  • RQ4ResNet18 や VGG19 などの深層アーキテクチャにおいて、レイヤー単位プルーニング(minimum_layer)はグローバルプルーニング(minimum)を上回る性能を示すか?
  • RQ5DropNetは、Tiny ImageNetを含む多様なアーキテクチャおよびデータセットに効果的に適用可能か?

主な発見

  • DropNetは、MNIST、CIFAR-10、Tiny ImageNetのMLPおよびCNNにおいて、ノード/フィルタを最大90%まで削減し、精度の低下を最小限に抑えられる。
  • ランダムな重み初期化で訓練されたプルーニングモデルは、元のロットリート・チケット初期化で訓練されたモデルと同等の性能を示し、特別な初期化の必要がないことを示している。
  • DropNetの性能は、訓練損失を貪欲に最小化するオーラクルプルーニング手法と同等である。
  • ResNet18 や VGG19 などの深層モデルでは、レイヤー単位プルーニング(minimum_layer)がグローバルプルーニング(minimum)を上回り、深層ネットワークではレイヤーごとの活性化統計が重要であることを示唆している。
  • 1回のイテレーションで大きな割合(例:p=0.5 または 0.9)をプルーニングすると性能が悪化するため、小さなプルーニングステップ(例:p=0.2)がより効果的であることが示された。
  • 同じレベルのプルーニングにおいて、APoZ指標よりも精度とロバスト性の両面で優れた性能を示しており、データ駆動型プルーニング基準としての優位性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。