Skip to main content
QUICK REVIEW

[論文レビュー] Joint Pruning & Quantization for Extremely Sparse Neural Networks.

Po‐Hsiang Yu, Sih-Sian Wu|arXiv (Cornell University)|Oct 5, 2020
Advanced Neural Network Applications参考文献 25被引用数 10
ひとこと要約

本論文では、ストリートマッチングネットワークにおける極めて高いスパarsityを達成するために、構造的プルーニングと量子化を統合的に適用する二段階パイプラインを提案する。プルーニングにはテイラー得点を、微細調整には新規の戦略を用いる。この手法により、モデルメモリを99%削減し、ハードウェアコストを最大99.9%まで低減しつつ、準SOTAの精度を維持する。特に、プルーニングのみでCIFAR-10およびImageNetのResNetにおいてもSOTAを上回る性能を達成した。

ABSTRACT

We investigate pruning and quantization for deep neural networks. Our goal is to achieve extremely high sparsity for quantized networks to enable implementation on low cost and low power accelerator hardware. In a practical scenario, there are particularly many applications for dense prediction tasks, hence we choose stereo depth estimation as target. We propose a two stage pruning and quantization pipeline and introduce a Taylor Score alongside a new fine-tuning mode to achieve extreme sparsity without sacrificing performance. Our evaluation does not only show that pruning and quantization should be investigated jointly, but also shows that almost 99% of memory demand can be cut while hardware costs can be reduced up to 99.9%. In addition, to compare with other works, we demonstrate that our pruning stage alone beats the state-of-the-art when applied to ResNet on CIFAR10 and ImageNet.

研究の動機と目的

  • 低コスト・低消費電力のエッジデバイスへのディープニューラルネットワークの効率的デプロイを可能にするため、モデルサイズと計算コストを大幅に削減すること。
  • プルーニングと量子化の相乗効果を調査し、特にプルーニングの順序が量子化ノイズとモデル精度に与える影響を明らかにすること。
  • 密度予測タスク(例:ストリートマッチング推定)において、性能を損なわず、最大99%のメモリ削減を達成する極めてスパースなモデルを実現すること。
  • プルーニングにのみ1つのハイパーパramータ(しきい値)を必要とする実用的で使いやすいパイプラインを構築し、リアルタイムモバイルアプリケーションに適したものとすること。

提案手法

  • 二段階パイプラインを提案:まず、損失関数の一次テイラー展開に基づくテイラー得点を用いて、非重要とされるフィルタを特定・削除する構造的プルーニングを実施する。
  • プルーニング後に、ネットワークの安定化と精度向上を図る新規の微細調整モードを導入し、特に高スパースな状態でも有効である。
  • プルーニング後、残存する重みに対して段階的量子化を適用し、それらを2の累乗値に変換することで、効率的な固定小数点演算を可能にする。
  • テイラー得点は、各フィルタの大きさに関する損失関数の勾配として計算され、フィルタレベルでの重要度推定を可能にする。
  • 本手法は、ストリートマッチングネットワーク(例:PSM-Net)に適用され、量子化の前にプルーニングを実施することで、量子化ノイズを最小限に抑える。
  • 一般化を検証するため、ストリートマッチング推定と標準分類ベンチマーク(CIFAR-10、ImageNet)の両方でパイプラインを評価する。

実験結果

リサーチクエスチョン

  • RQ1量子化を先に実施するか、プルーニングと量子化を交互に実施するのと比較して、プルーニングを先に実施することで、量子化ノイズが低減され、最終的なモデル精度が向上するか?
  • RQ2単一でシンプルなハイパーパramータ(プルーニングしきい値)で、全プルーニングプロセスを制御しつつ、高いスパースさと性能を達成できるか?
  • RQ3ストリートマッチング推定ネットワークにおける、精度が著しく低下する前までに達成可能な最大スパースさはどの程度か?
  • RQ4L1ノルムや幾何学的中央値など他のプルーニング基準と比較して、提案されたテイラー得点は、精度とスパースさのトレードオフにおいてどのように優れているか?
  • RQ5プルーニングのみのパイプラインが、CIFAR-10 や ImageNet などの標準ベンチマークでSOTA手法を上回る性能を達成できるか?

主な発見

  • 提案されたプルーニング手法のみで、CIFAR-10およびImageNetのResNetにおいてもSOTA性能を達成し、同等のスパースリティレベルで先行SOTA手法を上回った。
  • 量子化の前にプルーニングを実施することで、量子化ノイズが低減され、量子化を先に実施するか、交互に実施するのと比較して、より高い精度が得られた。
  • 本手法により、ストリートマッチング推定ネットワークにおいて、モデルメモリサイズを最大99%削減し、ハードウェアコストを最大99.9%まで削減した。
  • 69.95%のスパースリティでさえも、ImageNetにおけるトップ1精度が68.48%を維持し、ベースラインからわずか1.28%の精度低下にとどまった。
  • ストリートマッチング推定タスクでは、2%未満の精度損失に抑えられ、予測された深度マップの視覚的差異もほとんどなかった。
  • 本手法は、微細調整中にプルーニングが正則化として機能し、高スパース状態でも一般化性能が向上することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。