Skip to main content
QUICK REVIEW

[論文レビュー] Axiomatic Aggregations of Abductive Explanations

Gagan Biradar, Yacine Izza|arXiv (Cornell University)|Sep 29, 2023
Explainable Artificial Intelligence (XAI)Computer Science被引用数 3
ひとこと要約

本稿では、複数の帰納的説明を統合して頑健な特徴重要度スコアを生成する3つの公理的集約手法—責任指数(Responsibility Index)、Deegan-Packel指数(Deegan-Packel Index)、Holler-Packel指数(Holler-Packel Index)—を提案する。協力ゲーム理論と因果的強度指標を活用することで、これらの手法は望ましい性質を独自に満たし、敵対的攻撃下でのモデルバイアスの特定においてLIMEやSHAPを上回る性能を示す。

ABSTRACT

The recent criticisms of the robustness of post hoc model approximation explanation methods (like LIME and SHAP) have led to the rise of model-precise abductive explanations. For each data point, abductive explanations provide a minimal subset of features that are sufficient to generate the outcome. While theoretically sound and rigorous, abductive explanations suffer from a major issue -- there can be several valid abductive explanations for the same data point. In such cases, providing a single abductive explanation can be insufficient; on the other hand, providing all valid abductive explanations can be incomprehensible due to their size. In this work, we solve this issue by aggregating the many possible abductive explanations into feature importance scores. We propose three aggregation methods: two based on power indices from cooperative game theory and a third based on a well-known measure of causal strength. We characterize these three methods axiomatically, showing that each of them uniquely satisfies a set of desirable properties. We also evaluate them on multiple datasets and show that these explanations are robust to the attacks that fool SHAP and LIME.

研究の動機と目的

  • 1つの予測に対して複数の妥当ではあるが矛盾する最小特徴集合を生成する帰納的説明の限界を解消すること。
  • LIME や SHAP などの事後的説明手法の欠陥を克服すること。これらは操作に弱く、モデル構造を正確に捉えられていない。
  • 複数の帰納的説明を統合する一貫性のある、公理的フレームワークを構築すること。
  • LIME や SHAP の説明を操作する敵対的攻撃に対して、特に感受性の高い特徴の影響を特定する際の頑健性を確保すること。

提案手法

  • 正式な因果理論からの因果的強度指標「責任度」に基づく責任指数(Responsibility Index)を提案する。
  • 協力ゲーム理論から導かれるDeegan-Packel指数とHoller-Packel指数を導入し、帰納的説明集合における特徴重要度を定量化する。
  • 各集約手法を公理的特徴付けにより形式化し、望ましい性質の集合を満たす場合の一意性を証明する。
  • 実世界のデータセット(CompasおよびGerman Credit)を用い、敵対的攻撃下でのLIMEやSHAPとの性能比較を実施する。
  • 各データポイントの帰納的説明をSAT/SMTまたはMILPオラクルを用いて計算した後、提案されたインデックスで集約する。
  • 特徴を重要度スコア順にランク付けし、感受性のある属性(例:人種、性別)が上位寄与要因として正しく特定される頻度を測定して頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1帰納的説明を体系的に特徴重要度スコアに集約でき、理論的整合性を保ちつつ解釈可能性を向上させることができるか?
  • RQ2提案された集約手法が一意に望ましい公理の集合を満たし、説明生成における公平性と一貫性を保証できるか?
  • RQ3敵対的攻撃下でのモデルバイアスの検出において、提案手法はLIME や SHAP よりも優れているか?
  • RQ4感応性の高い特徴が操作されたり、結果と相関関係にある場合、集約手法がどの程度の頑健性を維持できるか?
  • RQ5公理的フレームワークは、帰納的説明にとどまらず、他の説明タイプに対しても一般化可能か?

主な発見

  • 責任指数(Responsibility Index)、Deegan-Packel指数(Deegan-Packel Index)、Holler-Packel指数(Holler-Packel Index)は、それぞれ別個の公理の集合を一意に満たし、理論的整合性と解釈可能性を保証する。
  • CompasデータセットにおけるLIME攻撃では、提案手法を用いた場合、テストインスタンスの84%以上で感受性の高い特徴「人種(Race)」が上位3位以内にランクされたが、LIMEでは相関のない2つの特徴が存在する状況でほぼ0%にとどまった。
  • 同様のデータセットにおけるSHAP攻撃では、提案インデックスを用いた場合、少なくとも86%のケースで感受性の高い特徴「人種(Race)」が最も重要な特徴として特定されたが、SHAPでは41.6%にとどまった。
  • German Creditデータセットでは、提案手法を用いた場合、87%以上のインスタンスで感受性の高い特徴「性別(Gender)」が最上位に特定されたが、SHAP や LIME はいかなるインスタンスでも上位にランクしなかった。
  • LIME や SHAP が敵対的操作に弱く、バイアスがある場合に失敗する中で、提案手法はモデルバイアスが存在する場合でも感受性の高い特徴を最も重要度の高いものとして正しく特定した。
  • LIME および SHAP の攻撃シナリオにおいて、提案手法はモデルの意思決定が感受性の高い属性に影響を受ける場合に、特にバイアスの特定において頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。