Skip to main content
QUICK REVIEW

[論文レビュー] Issues with post-hoc counterfactual explanations: a discussion

Thibault Laugel, Marie‐Jeanne Lesot|arXiv (Cornell University)|Jun 11, 2019
Explainable Artificial Intelligence (XAI)参考文献 19被引用数 21
ひとこと要約

この論文は、ポスト・ホ・カウンターファクチュアル解釈における3つの重要な欠陥、すなわち近接性、連結性、安定性を特定する。訓練データへのアクセスがなければ、ポスト・ホ・手法はしばしば局所的に忠実でない、現実のデータから切り離された、または微小な入力摂動に対して不安定な解釈を生成するため、実世界の応用における解釈可能性と信頼性を損なう。

ABSTRACT

Counterfactual post-hoc interpretability approaches have been proven to be useful tools to generate explanations for the predictions of a trained blackbox classifier. However, the assumptions they make about the data and the classifier make them unreliable in many contexts. In this paper, we discuss three desirable properties and approaches to quantify them: proximity, connectedness and stability. In addition, we illustrate that there is a risk for post-hoc counterfactual approaches to not satisfy these properties.

研究の動機と目的

  • 高品質なカウンターファクチュアル解釈を定義づけるべき3つの主要な望ましい特性、すなわち近接性、連結性、安定性を特定・分析すること。
  • 訓練データへのアクセスが制限されるポスト・ホ・カウンターファクチュアル手法が、これらの基準を満たさないことが多いことを示すこと。
  • ポスト・ホ・フレームワークでは、真のデータやモデル構造へのアクセスが欠落しているため、信頼性が低く、誤解を招く、あるいは実行不能な解釈が生じることを主張すること。
  • 現在のポスト・ホ・アプローチを再評価する必要を動機づけ、解釈品質を向上させるために訓練データを統合するよう提言すること。

提案手法

  • カウンターファクチュアル解釈を、入力 $ x $ に近い $ E(x) $ として形式化し、$ f(x) \neq f(E(x)) $ である異なるクラスに属するものと定義する。この定義では、モデルやデータへのアクセスなしに生成される。
  • 連結性を測る指標 $ C(E(x)) $ を導入する。これは、$ E(x) $ の $ \epsilon $-近傍のうち、$ E(x) $ と同じクラスに属するものの割合として定義され、$ C(E(x)) = 0 $ は、実データから完全に分離されていることを示す。
  • Alvarez Melis & Jaakkola (2018) が提案した安定性指標 $ \bar{L}_X(x) $ を適応し、局所的近傍における入力変化に対する解釈変化の比を測定する。
  • 合成データおよび実データセット(例:Iris)を用いた実験的評価により、HCLS や GS といったポスト・ホ・手法における近接性、連結性、安定性の違反を定量的に評価する。
  • 可視化と定量的分析を用いて、合成問題において最大17.8%のカウンターファクチュアルが実データから分離されていることを示す。
  • 訓練データを活用することでカウンターファクチュアルの品質を向上させることを提唱するが、これはポスト・ホ・仮定(ブラックボックスへのアクセスのみ)に反するものである。

実験結果

リサーチクエスチョン

  • RQ1ポスト・ホ・カウンターファクチュアル解釈は、元のインスタンスおよび意思決定境界からどの程度近接性を維持できていないのか?
  • RQ2ポスト・ホ・カウンターファクチュアル解釈は、どの程度実際の訓練データから分離されているのか? そして、これを測定する指標は何か?
  • RQ3なぜ安定性はカウンターファクチュアル解釈において問題となる基準となり得るのか? また、モデルのロバストネスとはどのように異なるのか?
  • RQ4訓練データへのアクセスがなければ、ポスト・ホ・カウンターファクチュアル手法が忠実でかつ実行可能な解釈を生成できるのか?
  • RQ5実世界のAIシステムにおけるユーザーの信頼性や意思決定に、分離されたまたは不安定なカウンターファクチュアルが及ぼす影響は何か?

主な発見

  • 2つの分離された意思決定領域を持つ合成問題において、HCLS や GS が生成したカウンターファクチュアルの17.8%が、$ C(E(x)) = 0 $ により、いかなる実際の訓練インスタンスとも連結されていなかった。
  • ポスト・ホ・カウンターファクチュアル手法は、特徴空間におけるデータが疎または存在しない領域に位置する解釈を生成する可能性があり、これにより実世界での実行可能性が損なわれる。
  • 安定性指標 $ \bar{L}_X(x) $ は、分類器の意思決定境界の自然な変動を反映しているだけであり、解釈生成手法の欠陥を示すものではないため、解釈品質の弱い代理指標となる。
  • 非常に安定しているが誤りである解釈(例:すべての入力に対して同じ誤った解釈)は、高い安定性スコアを達成することができるため、安定性だけでは信頼できる解釈を保証できない。
  • ポスト・ホ・設定では訓練データへのアクセスが欠落しているため、カウンターファクチュアルが現実のデータ分布に根ざしているかどうかを保証する能力が本質的に制限されている。
  • 本論文は、ポスト・ホ・仮定に反するが、信頼性があり、忠実で、有用なカウンターファクチュアル解釈を達成するためには、説明プロセスに訓練データを組み込む必要があると結論づける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。