Skip to main content
QUICK REVIEW

[論文レビュー] Utilizing Explainable AI for Quantization and Pruning of Deep Neural Networks

Muhammad Sabih, Frank Hannig|arXiv (Cornell University)|Aug 20, 2020
Adversarial Robustness in Machine Learning被引用数 16
ひとこと要約

本稿では、説明可能なAI(XAI)としてのDeepLIFTを用いて、構造的・非構造的プルーニング、重み付きk-meansクラスタリングを用いた非一様量子化、および混合精度整数量子化を統合的に最適化する、深層ニューラルネットワーク(DNN)圧縮の統合フレームワークを提案する。DeepLIFTを用いてニューロンおよび重みに重要度スコアを割り当てることで、CIFAR-10、CIFAR-100、ImageNetベンチマークにおいて、モデルサイズと計算コストを削減しながら、最先端または競争力のある精度を達成し、微調整なしでも従来手法を上回る性能を発揮する。

ABSTRACT

For many applications, utilizing DNNs (Deep Neural Networks) requires their implementation on a target architecture in an optimized manner concerning energy consumption, memory requirement, throughput, etc. DNN compression is used to reduce the memory footprint and complexity of a DNN before its deployment on hardware. Recent efforts to understand and explain AI (Artificial Intelligence) methods have led to a new research area, termed as explainable AI. Explainable AI methods allow us to understand better the inner working of DNNs, such as the importance of different neurons and features. The concepts from explainable AI provide an opportunity to improve DNN compression methods such as quantization and pruning in several ways that have not been sufficiently explored so far. In this paper, we utilize explainable AI methods: mainly DeepLIFT method. We use these methods for (1) pruning of DNNs; this includes structured and unstructured pruning of \\ac{CNN} filters pruning as well as pruning weights of fully connected layers, (2) non-uniform quantization of DNN weights using clustering algorithm; this is also referred to as Weight Sharing, and (3) integer-based mixed-precision quantization; this is where each layer of a DNN may use a different number of integer bits. We use typical image classification datasets with common deep learning image classification models for evaluation. In all these three cases, we demonstrate significant improvements as well as new insights and opportunities from the use of explainable AI in DNN compression.

研究の動機と目的

  • 多様なハードウェアデプロイメント環境におけるDNN圧縮のための標準的で説明可能かつ統合的なアプローチの欠如に応えること。
  • モデル予測への寄与度に基づき、説明可能なAIを活用して重要なニューロンおよび重みを特定することで、プルーニングおよび量子化技術の改善を図ること。
  • DNN圧縮においてMAC演算とパラメータ数(NPs)の両方を最適化する統合フレームワークの構築。
  • DeepLIFTに基づく重み付けを用いることで、非一様および混合精度量子化のクラスタリング効率を向上させること。
  • 微調整に依存しない競争力ある性能を実証し、再トレーニングへの依存を低減すること。

提案手法

  • 各ニューロンおよび重みの出力予測への寄与度スコアをDeepLIFTを用いて計算し、その重要度を反映する。
  • DeepLIFTスコアに基づく反復的プルーニングを適用し、構造的および非構造的設定の両方で低重要度のニューロン、フィルタ、重みを削除する。
  • 非一様量子化をガイドするためのDeepLIFT重み付きMSE(DWMSE)基準を導入し、層の感度とパラメータ数に基づいて重心に重みを付けることで、クラスタリング効率を向上させる。
  • 混合精度整数量子化のための粗いから細かい探索戦略を提案し、DeepLIFT感度スコアに基づいて層のビット幅を割り当て、精度の低下を最小限に抑える。
  • 微調整を追加せず、量子化後にバッチ正規化をキャリブレーションすることで、精度を維持する。
  • 感度駆動型のプルーニングおよび量子化を用いて、MAC数、NPs、または両方の最適化を可能にする統一パイプラインを提供する。

実験結果

リサーチクエスチョン

  • RQ1DeepLIFTに基づく重要度スコアは、DNNにおける構造的および非構造的プルーニングの性能向上に寄与するか?
  • RQ2DeepLIFTガイドド重み付きクラスタリングは、標準のMSEまたはヘッセ行列に基づく重み付けよりも、非一様量子化で優れた性能を発揮するか?
  • RQ3感度駆動型の粗いから細かい探索によるビット幅割り当ては、既存手法と比較して混合精度整数量子化でより高い精度を達成できるか?
  • RQ4提案手法は微調整なしでも高い精度を維持するか、特に低精度領域において顕著な性能を示すか?
  • RQ5一貫した性能を発揮する単一の説明可能なAI駆動フレームワークにより、複数のDNN圧縮技術(プルーニング、量子化)を統合できるか?

主な発見

  • 提案されたDeepLIFT重み付きMSE(DWMSE)アプローチは、Hessian重み付きMSEおよび標準MSEを上回る量子化精度を達成し、特に微調整なしでCIFAR-10のResNet20において顕著な効果を示した。
  • 混合精度整数量子化において、重みに79、活性化に79の累積ビット(CB)を割り当てた場合、CIFAR-10で91.2%のトップ-1精度を達成し、先行するヘッセ行列ベース手法(重み81、活性化88 CBで92.22%精度)を上回った。
  • DeepLIFTベースの感度スコアを用いたことで、フィルタおよび全結合層の重みの効果的なプルーニングが可能になり、圧縮効率が向上した。
  • 本フレームワークは、複数のデータセット(CIFAR-10、CIFAR-100、ImageNet)およびモデルで競争力ある性能を示し、広範な適用可能性を示した。
  • 特に微調整が行われない状況において、非一様量子化および混合精度設定で顕著な改善が観察された。
  • 統合アプローチにより、MAC演算とパラメータ数の両方を最適化でき、多様なハードウェアデプロイメント制約に柔軟に対応できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。