Skip to main content
QUICK REVIEW

[論文レビュー] Analyzing the Interpretability Robustness of Self-Explaining Models

Haizhong Zheng, Earlence Fernandes|arXiv (Cornell University)|May 27, 2019
Explainable Artificial Intelligence (XAI)参考文献 11被引用数 4
ひとこと要約

本稿は、自己説明モデル(SEMs)の解釈可能性のロバスト性を調査し、安定した説明を目的として設計されているにもかかわらず、モデルの予測を保持するが解釈可能な基本概念を著しく変化させる adversarial パーティクルに対して脆弱であることを示している。主な貢献は、第一段階の特徴抽出関数 $h(x)$ におけるロバスト性の欠如が根本的原因であると特定したことであり、今後の研究において基本概念の生成におけるロバスト性を強化すべきであると提言している。

ABSTRACT

Recently, interpretable models called self-explaining models (SEMs) have been proposed with the goal of providing interpretability robustness. We evaluate the interpretability robustness of SEMs and show that explanations provided by SEMs as currently proposed are not robust to adversarial inputs. Specifically, we successfully created adversarial inputs that do not change the model outputs but cause significant changes in the explanations. We find that even though current SEMs use stable co-efficients for mapping explanations to output labels, they do not consider the robustness of the first stage of the model that creates interpretable basis concepts from the input, leading to non-robust explanations. Our work makes a case for future work to start examining how to generate interpretable basis concepts in a robust way.

研究の動機と目的

  • 自己説明モデル(SEMs)が adversarial 入力の摂動に対して予測を保持するが、解釈可能性がロバストであるかどうかを評価すること。
  • モデル出力を保持するが説明を変更する adversarial 攻撃に対して、SEMs がどのように脆弱であるかを調査すること。
  • 現在の SEMs における解釈可能性の脆さの根本的原因を特定すること、特に解釈可能な基本概念を生成する第一段階の関数 $h(x)$ に注目すること。
  • 入力摂動に対して $h(x)$ のロバスト性を高める研究を今後の方向性として提唱すること。
  • adversarial 訓練と $h(x)$ における局所的リプシッツ制約を組み込むことで、SEMs の改善に向けた新たな方向性を提案すること。

提案手法

  • モデル出力を保持するが、解釈可能な基本概念 $h(x)$ の変化を最大化するように設計された標的型 adversarial 攻撃を考案・実装すること。
  • SENNS および PrototypeDL の両方のモデルに対して、$L_∞$ ノルム($\epsilon = 0.3$)を用いた投影勾配降下法(PGD)を用いて adversarial 例を生成すること。
  • 入力表現と学習済みプロトタイプ間の類似度を測る距離尺度 $D(x,y)$ を定義し、説明の一貫性を評価すること。
  • 自然例と adversarial 例の間の $h(x)$ の $l_2$-ノルム距離を、クラス内およびクラス外のサンプルにおいて比較することで、adversarial ロバスト性を評価すること。
  • 説明係数 $\theta(x)$ の入力変化に対する感度を定量化するため、局所的リプシッツ安定性測度 $\hat{L}(x)$ を適用すること。
  • MNIST に対して SEMs を訓練およびテストし、自然入力と adversarially 推論された入力の両方を用いて、説明の一貫性を比較すること。

実験結果

リサーチクエスチョン

  • RQ1自己説明モデル(SEMs)は、モデルの予測を保持するが説明を変化させる adversarial 摂動に対してロバストであるか?
  • RQ2解釈可能な基本概念を抽出する第一段階の関数 $h(x)$ は、小さな入力摂動に対して十分なロバスト性を示すか?
  • RQ3同じ予測ラベルに対して著しく異なる説明を生成させるように、adversarial 攻撃を設計できるか?
  • RQ4PrototypeDL において、adversarial 例とプロトタイプ間の距離は、自然例と比較してどう異なるか?
  • RQ5$h(x)$ が安定性の制約を受けていない場合、SEMs の解釈可能性のロバスト性はどの程度崩壊するか?

主な発見

  • モデル出力を保持する adversarial 摂動が、解釈可能な基本概念 $h(x)$ に著しい変化を引き起こすことが判明し、解釈可能性のロバスト性が失敗していることを示している。
  • adversarial クラス外距離が、自然なクラス内距離よりも小さく、adversarial 例がしばしば異なるクラスの特徴に類似していることを示している。
  • PrototypeDL において、adversarial 例は正しいプロトタイプよりも誤ったプロトタイプに近い距離に位置しており、誤った説明(例:数字「2」が「0」と類似していると説明される)を生じさせている。
  • adversarial 例の $D(x^*,y)$ と $\min_{y' \neq y} D(x^*,y')$ の分布には、正しいラベルと誤ったラベルの間に明確な差がなく、説明の正確性が失われていることを示している。
  • 局所的リプシッツ測度 $\hat{L}(x)$ は、$\theta(x)$ は安定しているが、不安定性は $h(x)$ に起因していることを確認しており、第一段階の特徴抽出器が弱みであることを裏付けている。
  • 結果から、$\theta(x)$ に安定性保証があるにもかかわらず、現在の SEMs は $h(x)$ の部分においてロバスト性に欠けていることが示され、今後の研究は $h(x)$ の安定化に注力すべきであると示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。