Skip to main content
QUICK REVIEW

[論文レビュー] Counterfactual Evaluation for Explainable AI

Yingqiang Ge, Shuchang Liu|arXiv (Cornell University)|Sep 5, 2021
Explainable Artificial Intelligence (XAI)参考文献 35被引用数 6
ひとこと要約

本論文は、顕著な特徴量に対して離散的および連続的な摂動を加えることで対仮説入力を生成することにより、説明可能AI手法の忠実性を評価するための対仮説評価(CE)フレームワークを提案する。この手法は、特にモデルへのアクセス制限がある状況下でも、消去ベースの指標よりも真の説明と高い相関を示し、忠実性評価における優れた一貫性とバイアスの低減を実証する。

ABSTRACT

While recent years have witnessed the emergence of various explainable methods in machine learning, to what degree the explanations really represent the reasoning process behind the model prediction -- namely, the faithfulness of explanation -- is still an open problem. One commonly used way to measure faithfulness is extit{erasure-based} criteria. Though conceptually simple, erasure-based criterion could inevitably introduce biases and artifacts. We propose a new methodology to evaluate the faithfulness of explanations from the extit{counterfactual reasoning} perspective: the model should produce substantially different outputs for the original input and its corresponding counterfactual edited on a faithful feature. Specially, we introduce two algorithms to find the proper counterfactuals in both discrete and continuous scenarios and then use the acquired counterfactuals to measure faithfulness. Empirical results on several datasets show that compared with existing metrics, our proposed counterfactual evaluation method can achieve top correlation with the ground truth under diffe

研究の動機と目的

  • 説明可能AIにおける忠実性を評価する課題に取り組むこと。既存の消去ベースの基準は、特徴量の削除に起因する内在的バイアスを抱える。
  • 因果関係に基づく一般化可能な評価手法を開発し、説明が実際にモデルの挙動を反映しているかどうかを評価する。
  • 特徴量の消去を制御された摂動に置き換えることで、入力構造を保持しつつモデルの感度をテストすることにより、評価の曖昧さを低減する。
  • 予測ラベルや完全な確率分布など、ブラックボックスモデル出力へのアクセスレベルが異なる状況でも忠実性評価を可能にする。
  • 複数のデータセットおよび説明手法を用いて、提案手法を既存の指標と比較して実証的に検証する。

提案手法

  • 顕著な特徴量に対する小さな摂動は予測を変えるべきであり、重要でない特徴量に対する大きな摂動は予測を変えないという2つの原則に基づく対仮説評価フレームワークを提案する。
  • 離散的(例:カテゴリカル特徴量)および連続的(例:埋め込み表現)入力空間における対仮説の生成に特化した異なるアルゴリズムを導入する。
  • 摂動の大きさを測るため、元の入力と対仮説入力との平均編集距離を「Proximity」と定義する。
  • モデルの予測を望ましい出力に切り替えることができた対仮説の割合を「Validity」と定義し、予測感度を測定する。
  • 元のクラスの予測確率の平均変化を捉えるために「Validity_soft」を導入し、モデルの信頼度の段階的変化を評価する。
  • ProximityとValidity/Validity_softを組み合わせた合成スコア 𝒞 または 𝒞_soft を定義し、モデル出力へのアクセス条件に応じて忠実性を評価する。

実験結果

リサーチクエスチョン

  • RQ1対仮説的推論は、消去ベースの指標に比べて、より信頼性が高くバイアスの少ない代替手段を提供できるか?
  • RQ2モデルへのアクセス制限がある状況下で、対仮説ベースの指標は、包括性や十分性といった既存の指標と比較してどのように性能を発揮するか?
  • RQ3本手法は、異なるデータセットおよび説明手法において、真の説明とどの程度相関するか?
  • RQ4評価スコアに Proximity を組み込むことで、忠実性評価の合理性と一貫性が向上するか?
  • RQ5本手法は、離散的および連続的入力タイプの両方を効果的に処理できるか?

主な発見

  • 予測ラベルのみが利用可能な状況下で、Adults データセットにおいて対仮説評価スコア 𝒞 (disc.) は真の順位付けと100%の一貫性を示し、DFR は完全に一貫性のない結果を示した。
  • Adults および Movie Reviews データセットの両方で、𝒞 (cont.) は、最良のベースライン(包括性)と比較して、Kendall’s τ および Spearman’s ρ の平均で17.83%の向上を達成した。
  • Adults データセットにおいて、Proximity と Validity_soft を組み合わせた 𝒞_soft は順位付けの結果を顕著に改善し、近接性を考慮した評価が合理性と一貫性を高めることを示した。
  • 複数の説明手法を評価する状況でも、𝒞_soft は全テストケースで真の順位付けと100%の一貫性を示し、Random、LIME、Anchor を上回った。
  • 本手法は、アクセスレベルが異なる状況でも頑健であることが示された。ラベルのみが利用可能な状況でも有効であり、確率分布や埋め込み表現が利用可能になるとさらに向上した。
  • 実証的結果から、𝒞 および 𝒞_soft は真の説明との相関が最も高く、対仮説的推論が消去ベースの基準に比べて忠実性評価において優れていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。