Skip to main content
QUICK REVIEW

[論文レビュー] Explaining Neural Networks via Perturbing Important Learned Features.

Ashkan Khakzar, Soroosh Baselizadeh|arXiv (Cornell University)|Nov 25, 2019
Explainable Artificial Intelligence (XAI)被引用数 7
ひとこと要約

本稿では、重要な隠れニューロン(学習された特徴)を同定し、これらのニューロンを維持したまま入力を摂動させて出力変化を最大化する、新しい入力特徴の帰属割り当て手法であるPruneGradを提案する。高レベルの特徴に焦点を当てることで、入力要素間の相関関係を捉えることができ、3つのベンチマーク(健全性チェック、ピクセル摂動、Remove and Retrain(ROAR))において最先端の性能を達成する。

ABSTRACT

Attributing the output of a neural network to the contribution of given input elements is one way of shedding light on the black box nature of neural networks. We propose a novel input feature attribution method that finds an input perturbation that maximally changes the output neuron by exclusively perturbing important hidden neurons (i.e. learned features) on the path to output neuron. Given an input, this is achieved by 1) pruning unimportant neurons, and subsequently 2) finding a local input perturbation that maximizes the output in the pruned network. Since our method considers the importance of hidden neurons (high-level features), it inherently considers interdependencies between multiple input elements, which is vital for input feature attribution. We propose PruneGrad, an efficient gradient-based solution for the pruning and perturbation steps of our method. The efficacy of our method is evaluated by quantitatively benchmarking against other attribution methods using 1) sanity checks, 2) pixel perturbation, and 3) Remove and Retrain (ROAR). Our results show that while most of the existing attribution methods are prone to fail or get mediocre results in at least one benchmark, our proposed method achieves state of the art results in all three benchmarks. The results are further supported by comparative visual evaluation.

研究の動機と目的

  • 入力要素間の相関関係を捉えられていない既存の入力特徴帰属割り当て手法の限界を解消すること。
  • 生の入力特徴ではなく、高レベルの重要な隠れニューロンに焦点を当てることで、モデル出力を帰属割り当てする手法を開発すること。
  • 原理的なプルーニングと勾配ベースの摂動を通じて、帰属割り当てのロバスト性と信頼性を向上させること。
  • 健全性チェック、ピクセル摂動、およびRemove and Retrain(ROAR)を含む、複数のベンチマークを用いて、手法を包括的に評価すること。

提案手法

  • まず、出力ニューロンへの寄与度に基づいて、重要でない隠れニューロンをプルーニングし、最も重要な特徴のみを保持する。
  • 次に、プルーニングされたネットワーク内で出力を最大化するような局所的入力摂動を実行し、保持された特徴に影響を与える入力を重点的に扱う。
  • PruneGradは、プルーニングされたネットワーク構造を維持したまま、摂動を効率的に計算するために勾配ベースの最適化を用いる。
  • 個々の入力ユニットではなく、高レベルの特徴上で動作するため、入力要素間の相関関係を内蔵的にモデル化する。
  • ネットワークの内部表現を活用して、意味的に意味のある入力変更に向かって摂動を誘導する。
  • 効率的かつスケーラブルに設計されており、大規模なニューラルネットワークへの応用が可能である。

実験結果

リサーチクエスチョン

  • RQ1学習済み隠れニューロン上で動作する帰属割り当て手法は、既存の手法を上回って意味のある入力寄与度を捉えることができるか?
  • RQ2帰属割り当ての信頼性をテストするきめ細かい健全性チェックにおいて、この手法はどの程度の性能を示すか?
  • RQ3入力特徴を削除してモデルを再訓練する際(ROARベンチマーク)、この手法はどの程度の性能を維持するか?
  • RQ4生の入力特徴に基づく手法と比較して、この手法は入力要素間の相関関係をどれほどよく捉えているか?
  • RQ5定量的および定性的に、この手法は最先端の帰属割り当て技術と比較してどの程度優れているか?

主な発見

  • PruneGradは、健全性チェック、ピクセル摂動、およびRemove and Retrain(ROAR)という3つのベンチマークすべてで最先端の性能を達成した。
  • 大多数の既存手法とは異なり、PruneGradは3つの評価ベンチマークのいずれにおいても失敗したり、中程度の結果を出したりすることはない。
  • 多様な評価プロトコルにわたる一貫した高い性能から、優れたロバスト性が裏付けられた。
  • 視覚的評価では、ベースラインと比較して、PruneGradがより現実的で意味的に意味のある帰属マップを生成することが確認された。
  • 個々のピクセルや入力ユニットではなく、高レベルの特徴上で動作することにより、入力要素間の相関関係を効果的に捉えた。
  • アブレーションスタディにより、摂動の前に重要なニューロンをプルーニングすることが、正確な帰属割り当てに不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。