Skip to main content
QUICK REVIEW

[論文レビュー] Aggregating explanation methods for stable and robust explainability

Laura Rieger, Lars Kai Hansen|arXiv (Cornell University)|Mar 1, 2019
Explainable Artificial Intelligence (XAI)参考文献 44被引用数 6
ひとこと要約

本稿では、ニューラルネットワークの説明手法を複数集約することで、安定性、耐性、特徴の完全性を向上させる手法を提案する。Grad-CAM、ガイドドバックプロパゲーション、LRPといった手法を平均または分散に基づく集約(AGG-Mean および AGG-Var)によって統合することで、エピステミック的不確実性が低減され、敵対的攻撃に対する耐性が著しく向上し、ImageNet、MNIST、FashionMNISTの各データセットにおいて個々の手法を上回る性能を示した。

ABSTRACT

Despite a growing literature on explaining neural networks, no consensus has been reached on how to explain a neural network decision or how to evaluate an explanation. Our contributions in this paper are twofold. First, we investigate schemes to combine explanation methods and reduce model uncertainty to obtain a single aggregated explanation. We provide evidence that the aggregation is better at identifying important features, than on individual methods. Adversarial attacks on explanations is a recent active research topic. As our second contribution, we present evidence that aggregate explanations are much more robust to attacks than individual explanation methods.

研究の動機と目的

  • 複数の説明手法を組み合わせることで、ニューラルネットワークの説明におけるエピステミック的不確実性を低減すること。
  • 多様な説明技術を統合することで、説明の安定性と完全性を向上させること。
  • 説明手法に対する敵対的攻撃に対する耐性を高めること。
  • 集約された説明が、関連する特徴を特定する能力や改ざんに対する耐性において、個々の手法を上回るかどうかを評価すること。
  • 集約プロセスが、モデルの変更なしに滑らかでより信頼性の高い説明を実現するかどうかを調査すること。

提案手法

  • 2つの集約戦略を提案する:AGG-Mean は複数の手法からの説明マップの要素ごとの平均を計算し、AGG-Var は説明の分散を用いて顕著な領域を特定する。
  • 多様な説明手法を対象とする:サリエンシーマップ(SM)、ガイドドバックプロパゲーション(GB)、LRP、Grad-CAM(GC)、統合勾配(IG)、SmoothGrad(SG)。
  • 感度分析(Sensitivity-n)、特徴の重要度比較、敵対的攻撃の転送性テストを含む、段階的な評価フレームワークを適用する。
  • 説明の質と耐性を評価するために、ピアソン積率相関係数(PCC)、平均二乗誤差(MSE)、上位10%の和集合(top-10% union)などの指標を用いる。
  • 個々の手法を標的にした敵対的攻撃を実施し、その後集約された説明を標的にして、転送性と耐性をテストする。
  • 複数のデータセット(ImageNet、MNIST、FashionMNIST)およびネットワークアーキテクチャを用いて、性能と耐性を比較する可視化を実施する。

実験結果

リサーチクエスチョン

  • RQ1複数の説明手法を統合することで、エピステミック的不確実性が低減され、個々の手法よりも安定的かつ完全な説明が得られるか?
  • RQ2多様な説明手法の集約が、異なるアーキテクチャやデータセットにおいて関連する画像特徴を特定する性能を向上させるか?
  • RQ3敵対的攻撃に対して、集約された説明の耐性は個々の説明手法と比べてどのように異なるか?
  • RQ4集約プロセスが、説明手法間での敵対的攻撃の転送性をどの程度低減させるか?
  • RQ5集約が、追加の計算コストを要しないSmoothGradと同様の滑らかさの効果を達成できるか?

主な発見

  • AGG-Mean は、ImageNet、MNIST、FashionMNISTの全指標において、すべての個別手法を上回り、評価で最小のMSE(0.89 × 10⁻⁹)と最大のPCC(0.54)を達成した。
  • 集約された説明は、敵対的攻撃に対して著しく高い耐性を示し、類似度指標(PCC および topK)から、攻撃の転送性が個別手法よりも低いことが示された。
  • 1つの手法(例:GB)を標的にした敵対的攻撃は、他の手法(例:LRP)には効果的に転送されず、さらに集約された説明に対してもほとんど転送されないことが確認され、耐性の向上が裏付けられた。
  • 攻撃下でもAGG-Mean手法は、元の説明構造を最もよく保持していた。図6の可視化により、摂動に対してもヒートマップの整合性が保たれていることが確認された。
  • 集約戦略は、SmoothGradと同様の滑らかさの効果を、モデルの変更なしに、手法の多様性に起因する内在的平滑化によって達成した。
  • 全テストアーキテクチャおよびデータセットにおいて、集約手法は説明の質と敵対的耐性の両面で、個別手法を一貫して上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。