Skip to main content
QUICK REVIEW

[論文レビュー] FAR: A General Framework for Attributional Robustness

Adam Ivankay, I. Girardi|arXiv (Cornell University)|Oct 14, 2020
Explainable Artificial Intelligence (XAI)被引用数 6
ひとこと要約

本稿では、局所的な入力近傍内でのアトリビューションマップ間の最大相違度を最小化することにより、アトリビューションに頑健な説明を持つ深層ニューラルネットワークを訓練する一般化フレームワークFARを提案する。2つの新規手法AATおよびAdvAATを導入し、予測の頑健性とアトリビューションの頑健性を同時に最適化することで、視覚データセット全体で最先端または競争力のあるアトリビューションの頑健性を達成するとともに、トレーニングおよび推定のハイパーパrameter依存性を低減する。

ABSTRACT

Attribution maps are popular tools for explaining neural networks predictions. By assigning an importance value to each input dimension that represents its impact towards the outcome, they give an intuitive explanation of the decision process. However, recent work has discovered vulnerability of these maps to imperceptible adversarial changes, which can prove critical in safety-relevant domains such as healthcare. Therefore, we define a novel generic framework for attributional robustness (FAR) as general problem formulation for training models with robust attributions. This framework consist of a generic regularization term and training objective that minimize the maximal dissimilarity of attribution maps in a local neighbourhood of the input. We show that FAR is a generalized, less constrained formulation of currently existing training methods. We then propose two new instantiations of this framework, AAT and AdvAAT, that directly optimize for both robust attributions and predictions. Experiments performed on widely used vision datasets show that our methods perform better or comparably to current ones in terms of attributional robustness while being more generally applicable. We finally show that our methods mitigate undesired dependencies between attributional robustness and some training and estimation parameters, which seem to critically affect other competitor methods.

研究の動機と目的

  • 医療や金融など安全が求められる応用分野において、アトリビューションマップが人間が認識できない摂動に対して脆弱である問題に対処すること。
  • 予測の頑健性とは独立して、アトリビューションの頑健性を一般化され、柔軟なトレーニング目的として形式化すること。
  • 既存手法が抱える問題である、モデル初期化、ReLU近似パラメータ、その他のハイパーパrameterに起因するアトリビューションの頑健性への不必要な依存性を低減すること。
  • 元のアトリビューションマップと敵対的アトリビューションマップの相関を高めるように直接最適化する新しいトレーニング手法の開発

提案手法

  • 入力とその摂動版のアトリビューションマップ間の最大相違度を最小化する一般化正則化項とトレーニング目的関数を提案し、L∞-ボール半径εの局所的入力近傍内に制限する。
  • 予測が変化しない条件の下で、元のアトリビューションマップと摂動版アトリビューションマップ間の最大距離を1から引いた値として、アトリビューションの頑健性(AR)を定義する。
  • FARフレームワークの具体例として、AAT(Adversarial Attribution Training)およびAdvAAT(Adversarial Training with Attribution Training)を導入し、予測の頑健性とアトリビューションの頑健性を同時に最適化する。
  • アトリビューション手法として、Integrated Gradients(IG)とサリエンシーマップを用い、IGはベースラインから入力へのパス積分によって計算する。
  • 敵対的攻撃生成のための勾配推定に、パラメータβで制御される滑らかなReLU近似を用いた2階微分近似を適用する。
  • アトリビューションマップの相違度を最大化するように設計された、投影勾配降下法に基づく攻撃(IFIA)を用い、トレーニング中に頑健性向上のための敵対的例を生成する。

実験結果

リサーチクエスチョン

  • RQ1特定のアトリビューション手法や距離尺度に依存しない、一般化された統一フレームワークを、アトリビューションマップに頑健な深層ニューラルネットワークのトレーニングに構築できるか?
  • RQ2FARフレームワークは、既存手法と比較して、データセット全体にわたるアトリビューションの頑健性と一般化性能において優れているか?
  • RQ3アトリビューションの頑健性推定値が、モデル重み初期化、ReLU近似のきつい程度(β)、その他のハイパーパラメータにどれほど依存しているか?
  • RQ4予測の頑健性とアトリビューションの頑健性を同時に最適化することで、別個のトレーニングや既存手法よりも優れた性能が得られるか?

主な発見

  • AATおよびAdvAATは、Restricted ImageNetにおいて、それぞれトップ300インターセクションスコア0.93および0.94を達成し、自然なモデル(0.12)を著しく上回り、敵対的摂動に対して強い頑健性を示した。
  • アトリビューションの頑健性(INおよびCOで測定)は正則化パラメータλに比例し、λ ≥ 1で飽和する傾向を示し、頑健性と精度のトレードオフを効果的に制御できることを示した。
  • 提案手法は、重み初期化に起因するアトリビューションの頑健性への依存性を軽減し、ベースラインモデルと比較して異なる初期化における分散を低減した。
  • アトリビューションの頑健性推定値はReLU近似パラメータβに極めて敏感であることが判明。著しいβの値では2階微分勾配が消滅し、攻撃の効果に影響を与えることが実証された。
  • 本フレームワークは既存手法を超えて一般化可能であり、真の説明の利用が可能で、複数のアトリビューション手法および距離尺度をサポートする。
  • 実験により、AATおよびAdvAATが、初期化やβといったハイパーパラメータに起因する不必要な依存性を低減していることが確認され、これらが他の手法の頑健性推定に顕著に影響を与えることが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。