Skip to main content
QUICK REVIEW

[論文レビュー] Improving Feature Attribution through Input-specific Network Pruning

Ashkan Khakzar, Soroosh Baselizadeh|arXiv (Cornell University)|Nov 25, 2019
Adversarial Robustness in Machine Learning参考文献 34被引用数 6
ひとこと要約

本論文は、1回の逆伝播で特定入力に対して不要なニューロンを削除する入力固有のネットワーク prune を提案し、ノイズの多い勾配ベースの説明をグローバルに意味のある重要度マップに洗練させることで、深層ニューラルネットワークにおける特徴の帰属割り当てを改善する。この手法により、ROAR、ピクセル摂動、健全性チェックを含む複数のベンチマークで、既存手法を上回るより正確で細分化された帰属割り当てマップが得られる。

ABSTRACT

Attributing the output of a neural network to the contribution of given input elements is a way of shedding light on the black-box nature of neural networks. Due to the complexity of current network architectures, current gradient-based attribution methods provide very noisy or coarse results. We propose to prune a neural network for a given single input to keep only neurons that highly contribute to the prediction. We show that by input-specific pruning, network gradients change from reflecting local (noisy) importance information to global importance. Our proposed method is efficient and generates fine-grained attribution maps. We further provide a theoretical justification of the pruning approach relating it to perturbations and validate it through a novel experimental setup. Our method is evaluated by multiple benchmarks: sanity checks, pixel perturbation, and Remove-and-Retrain (ROAR). These benchmarks evaluate the method from different perspectives and our method performs better than other methods across all evaluations.

研究の動機と目的

  • 複雑なネットワークアーキテクチャのため、勾配ベースの帰属割り当て手法がノイズが多く局所的な重要度推定を生じるという限界に対処する。
  • 入力固有の prune を通じて、局所的な勾配信号をグローバルな重要度表現に変換することで、帰属割り当てマップの忠実度を向上させる。
  • 入力固有の prune と adversarial perturbations の間の理論的関連を提示し、本手法の有効性を正当化する。
  • ROAR やピクセル摂動、健全性チェックを含む複数の定量的ベンチマークを用いて、提案手法の包括的評価を行い、堅牢性と信頼性を確保する。
  • prune が帰属割り当てマップの解釈可能性を向上させつつ、計算効率を維持することを示す。

提案手法

  • 1回の逆伝播で、特定入力に対する予測に寄与が小さいニューロンを削除することで、入力固有の prune を適用する。
  • prune されたネットワーク上で勾配を計算し、局所的なノイズではなくグローバルな重要度を反映する帰属割り当てマップを生成する。
  • ニューロンの活性化の大きさに基づく prune しきい値を用い、与えられた入力に対して最も関連性の高いニューロンのみを保持する。
  • 数学的定式化を通じて、prune されたネットワークの勾配が、予測変化を最大化する最適な摂動に近似することを示す。
  • Remove-and-Retrain (ROAR) ベンチマークを活用し、帰属割り当てされた特徴が実際にモデルの予測に寄与しているかどうかを定量的に検証する。
  • チャネルごとの絶対勾配を合算することで、中間層の帰属割り当てを可視化し、高次元のニューロンレベルの重要度の解釈を可能にする。

実験結果

リサーチクエスチョン

  • RQ1入力固有の prune は、ノイズの多い局所的勾配をグローバルに意味のある特徴帰属割り当てに変換できるか?
  • RQ21つの入力に対してネットワークを prune することにより、標準的な勾配ベース手法と比較して帰属割り当てマップの品質と解釈可能性はどのように向上するか?
  • RQ3prune されたネットワークの勾配は、予測変化を最大にする最適な adversarial perturbations をどの程度近似するか?
  • RQ4提案手法は、ROAR やピクセル摂動を含む複数の定量的ベンチマークで、既存の帰属割り当て技術を上回るか?
  • RQ5prune は、adversarial perturbations が実際に重要なモデル特徴に基づいているのか、それとも誤った活性化に基づいているのかを明らかにするのを支援するか?

主な発見

  • 提案手法の PruneGrad は、BirdSnap や CIFAR-10 を含む複数のデータセットで、ROAR ベンチマークで最先端のパフォーマンスを達成した。
  • PruneGrad と PrunePGD(pruned network 上での投影勾配降下法を用いたもの)は、ほぼ同一の ROAR スコアを達成しており、pruned network 上の勾配が最適摂動に近い近似であることを裏付けた。
  • prune の強度が高くなるにつれ、pruned network 上の adversarial perturbations はより重要な特徴を反映するようになり、prune が不要な経路を除去し、帰属割り当てを洗練させることを確認した。
  • 本手法はすべての健全性チェックに合格し、帰属割り当てがランダム化の影響ではなくモデル重みに依存していることを示した。
  • ピクセル摂動の結果から、PruneGrad は、削除された際に予測信頼度が最も大きく低下する特徴を明確に強調しており、高い忠実度を確認した。
  • ResNet-50 や VGG-16 における可視化結果から、PruneGrad は特に深層層において、標準的な勾配手法よりも正確で詳細な帰属割り当てマップを生成することがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。