Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Dead Weights and Units in Neural Networks

Utku Evci|arXiv (Cornell University)|Jun 15, 2018
Advanced Neural Network Applications参考文献 28被引用数 4
ひとこと要約

本稿では、バイアス伝播を用いた損失変化の効率的近似であるMean Replacement Score (MRS) を用いて、学習に寄与しなくなったニューロン(死んだユニット)を検出し、 pruning するための新規手法を提案する。この手法は、MNIST で性能に低下を来さずに最大 5 倍のモデルサイズ削減を達成し、パラメータレベルの pruning よりもユニット単位での pruning が優れていることを示している。

ABSTRACT

Deep Neural Networks are highly over-parameterized and the size of the neural networks can be reduced significantly after training without any decrease in performance. One can clearly see this phenomenon in a wide range of architectures trained for various problems. Weight/channel pruning, distillation, quantization, matrix factorization are some of the main methods one can use to remove the redundancy to come up with smaller and faster models. This work starts with a short informative chapter, where we motivate the pruning idea and provide the necessary notation. In the second chapter, we compare various saliency scores in the context of parameter pruning. Using the insights obtained from this comparison and stating the problems it brings we motivate why pruning units instead of the individual parameters might be a better idea. We propose some set of definitions to quantify and analyze units that don't learn and create any useful information. We propose an efficient way for detecting dead units and use it to select which units to prune. We get 5x model size reduction through unit-wise pruning on MNIST.

研究の動機と目的

  • 訓練中または訓練後において、学習を停止し有用な情報を提供しなくなったユニット(ニューロン)を特定・削除すること。
  • 個々のパラメータではなくユニット全体を pruning することにより、よりコンact で高速なモデルを実現し、モデルの効率性を向上させること。
  • 高価なヘッセ行列の計算を伴わずに、2 階の近似に基づく効率的な死んだユニット検出手法を開発すること。
  • パラメータレベルの pruning よりもユニットレベルの pruning が、モデル精度を維持したままより優れた圧縮を達成できることを示すこと。
  • MRS に基づく重要度スコアを用いた、ユニットおよびパラメータの pruning を実行可能な実用的でオープンソースの PyTorch ベースのライブラリを提供すること。

提案手法

  • ユニットの出力をその平均値に置き換えた際の損失変化の効率的 1 階近似として、Mean Replacement Score (MRS) を導入する。
  • バイアス伝播を用いて、ユニットの削除が全体の損失に与える影響を推定し、高速かつ正確な重要度スコアを実現する。
  • 再訓練を伴わずに pruning をシミュレートできるマスキング機構を採用し、ユニット削除の影響を効率的に評価可能にする。
  • MRS を用いてユニットの損失への寄与度を順序付け、最も寄与度の低いユニットを削除対象とする。
  • 2段階の pruning 戦略を実装:まず MRS を用いて死んだユニットを特定し、次に微分可能マスキング層を用いて削除する。
  • PyTorch ライブラリ `pytorchpruner` を開発し、MRS およびヘッセ行列に基づくスコアを用いた、パラメータレベルおよびユニットレベルの両方の pruning をサポートする。

実験結果

リサーチクエスチョン

  • RQ1訓練中または訓練後に、損失変化の効率的で微分可能な近似を用いて、死んだユニットを信頼性高く検出できるか?
  • RQ2個々のパラメータではなくユニット全体を pruning することにより、性能に劣化を来さずにより優れたモデル圧縮が達成できるか?
  • RQ3MRS は、従来の重要度測定法(例:L2 ノルム、勾配の大きさ)と比較して、寄与しないユニットを特定する上で優れているか?
  • RQ4高い学習率がユニットの死に与える影響は何か? また、MRS はこのようなユニットを早期に検出できるか?
  • RQ5MRS を用いたユニット pruning は、MNIST や CIFAR-10 といった標準的なビジョンベンチマークで顕著なモデル圧縮を達成できるか?

主な発見

  • MRS を用いたユニット pruning により、MNIST データセットでモデルサイズを 5 倍に圧縮したが、テスト精度に低下は認められなかった。
  • 高い学習率や活性化関数の飽和(例:ReLU、Tanh)によって死んだユニットが発生する場合でも、MRS を用いて信頼性高く検出可能である。
  • 特に深層または複雑なネットワークにおいて、MRS はノルムに基づく重要度測定法を上回り、寄与しないユニットを効果的に同定できた。
  • 従来の勾配ベース手法が失敗するバッチ正則化と ReLU を併用したネットワークにおいても、MRS は死んだユニットを検出できた。
  • 提案された `pytorchpruner` ライブラリにより、パラメータおよびユニットレベルの両方の pruning を効率的かつ再現可能に実行可能となった。
  • MRS を用いた pruning は、ReLU や Tanh を含むさまざまなアーキテクチャおよび活性化関数において、安定的かつ効果的に機能した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。