[論文レビュー] The Dangers of Post-hoc Interpretability: Unjustified Counterfactual Explanations
この論文は、訓練データへの経路連結性に基づく、事後的対蹠的説明の正当化基準を導入し、不当な例を検出するためのテストを提案する。実験の結果、最先端の手法が脆弱なインスタンスにおいて最大37%の割合で正当化されない対蹠的説明を生成していることが判明し、真のデータへの忠実性に深刻な欠陥が存在することが明らかになった。
Post-hoc interpretability approaches have been proven to be powerful tools to generate explanations for the predictions made by a trained black-box model. However, they create the risk of having explanations that are a result of some artifacts learned by the model instead of actual knowledge from the data. This paper focuses on the case of counterfactual explanations and asks whether the generated instances can be justified, i.e. continuously connected to some ground-truth data. We evaluate the risk of generating unjustified counterfactual examples by investigating the local neighborhoods of instances whose predictions are to be explained and show that this risk is quite high for several datasets. Furthermore, we show that most state of the art approaches do not differentiate justified from unjustified counterfactual examples, leading to less useful explanations.
研究の動機と目的
- 訓練データへの連続的接続性に基づく対蹠的説明の正当化基準を定義すること。
- 事後的解釈可能性における不当な対蹠的例の生成リスクを評価するためのテストを開発すること。
- 既存の事後的対蹠的説明手法が不当な説明を生成する脆弱性を評価すること。
- 現在のアプローチでは、モデルおよび真のデータへの忠実性がしばしば損なわれることを示すこと。
- 将来の解釈可能性手法に訓練データへの接続性を組み込むべきであることを提唱すること。
提案手法
- 訓練インスタンスと同じ予測クラスに属する連結領域に位置する説明が正当化された対蹠的説明(JCF)であると形式的に定義する。
- 対蹠的例が同じ予測クラスの訓練インスタンスにεチェーンを介して接続可能かどうかを確認する検証手順(VE)を導入する。
- 最近接の近傍点を中心とした超球層を用いて、連結する訓練インスタンスの探索空間を拡張する。
- HCLS、Growing Spheres、LOREが生成する対蹠的例に対して、VE手順を適用し、正当化スコア(J_E(x))を評価する。
- 複数のインスタンスと実行回数における平均正当化スコア(J̄)を測定し、手法の頑健性を評価する。
- 局所的なリスクが高く、不当な対蹠的例が生成されやすいインスタンスを特定するためのリスクスコア(R_x)を用いる(R_x ≥ 0.25)。
実験結果
リサーチクエスチョン
- RQ1事後的対蹠的説明は、訓練データに連続的な経路で接続することで正当化可能か?
- RQ2特に高リスクの局所的近傍において、事後的手法が不当な対蹠的例を生成するリスクはどの程度か?
- RQ3最先端の事後的対蹠的手法は、正当化された例をどの程度生成できるか?
- RQ4分類器の複雑さやデータ構造は、対蹠的説明の正当化にどの程度影響を与えるか?
- RQ5同じ正当化フレームワーク下で、敵対的例の連結性を分析できるか?
主な発見
- 高リスク(R_x ≥ 0.25)のインスタンスにおいて、最先端手法が生成する正当化された対蹠的説明の割合(J̄)は最低で63%にまで低下する。
- HCLSは、距離よりも分類の信頼性に焦点を当てているため、Growing Spheresに比べてわずかに優れた正当化性能を示す。
- LOREはボストンランダムフォレストおよびリシジビティデータセットで100%の正当化を達成しており、特定の設定では優れた性能を示している。
- 正当化率はデータセットごとに顕著に異なることが判明し、IrisではHCLSとGSともに63%、BostonSVCではHCLSで95%を記録した。
- 本研究は、事後的対蹠的手法が真のデータへの接続性に欠けるため、不当な例の生成に本質的に脆弱であることを確認した。
- 結果から、現在の事後的手法では、モデルおよび訓練データへの忠実性を信頼できる形で保証できないことが示され、今後の説明生成手法における訓練データの統合が不可欠であると示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。