Skip to main content
QUICK REVIEW

[論文レビュー] Model-agnostic and Scalable Counterfactual Explanations via Reinforcement Learning

Robert-Florian Samoilescu, Arnaud Van Looveren|arXiv (Cornell University)|Jun 4, 2021
Explainable Artificial Intelligence (XAI)被引用数 11
ひとこと要約

本稿では、1回の順伝播でスパースで分布内に収束する反事実的説明を生成する、モデルに依存しない強化学習ベースのフレームワークを提案する。このフレームワークにより、バッチ処理、ターゲットおよび特徴量の条件付き処理、および表形式データおよび画像データの両方への対応が可能となる。本手法は、個々のインスタンスに対する反復的最適化を排除することで、最先端のベースラインと同等の性能を達成する。

ABSTRACT

Counterfactual instances are a powerful tool to obtain valuable insights into automated decision processes, describing the necessary minimal changes in the input space to alter the prediction towards a desired target. Most previous approaches require a separate, computationally expensive optimization procedure per instance, making them impractical for both large amounts of data and high-dimensional data. Moreover, these methods are often restricted to certain subclasses of machine learning models (e.g. differentiable or tree-based models). In this work, we propose a deep reinforcement learning approach that transforms the optimization procedure into an end-to-end learnable process, allowing us to generate batches of counterfactual instances in a single forward pass. Our experiments on real-world data show that our method i) is model-agnostic (does not assume differentiability), relying only on feedback from model predictions; ii) allows for generating target-conditional counterfactual instances; iii) allows for flexible feature range constraints for numerical and categorical attributes, including the immutability of protected features (e.g. gender, race); iv) is easily extended to other data modalities such as images.

研究の動機と目的

  • 個々のインスタンスに対する反復的最適化を必要とする従来の反事実的説明生成手法の計算非効率性を解消すること。
  • 勾配情報やモデル固有の変更を必要とせず、モデルの予測フィードバックのみに依存するモデルに依存しないフレームワークを開発すること。
  • 目的予測への条件付きおよび特徴量制約付きの反事実的説明生成を可能とすること。具体的には、不変の特徴量(例:性別、年齢、教育水準)や値域制限のある特徴量を含む。
  • 画像などの高次元データモダリティに対しても、最小限のアーキテクチャ変更で対応可能なように拡張すること。
  • 有効性や分布内品質を損なわせることなく、高速かつスケーラブルな反事実的説明生成を実現すること。

提案手法

  • 深層強化学習エージェントが、スパarsity、有効性、分布内品質の目的を組み合わせた報酬関数を最小化するように入力特徴量を操作することで反事実的インスタンスを生成する。
  • エージェントは、望ましいターゲット予測に向けた生成を導くための条件付きベクトルを用いることで、ターゲット条件付き反事実的説明を実現する。
  • 不変特徴量や値域制限などの特徴量制約は、推論時にマスクされたアクション空間を介して強制され、生成時に制約付きの値がサンプリングされる。
  • 事前に学習されたオートエンコーダーを用いて分布内品質を再構成および評価し、訓練の安定化のための一貫性損失を導入する。
  • 訓練パイプラインは完全にモデルに依存せず、勾配情報ではなくブラックボックスモデルの予測結果のみを報酬フィードバックとして利用する。
  • オートエンコーダーと観測空間の適応により、表形式データおよび画像データの両方を最小限のアーキテクチャ変更で対応可能にしている。

実験結果

リサーチクエスチョン

  • RQ1反復的最適化の代わりに学習可能でエンドツーエンドの強化学習プロセスを導入することで、反事実的説明生成のスケーラビリティと効率性を向上させられるか?
  • RQ2モデルの勾配情報やアーキテクチャに関する仮定を必要としないモデルに依存しない手法が、有効でスパースかつ分布内に収束する反事実的説明をどれほど効果的に生成できるか?
  • RQ3実世界のデータセットにおいて、不変性や値域制限などの特徴量制約が課された状況で、本手法の性能はどの程度であるか?
  • RQ4画像などの高次元データモダリティに対しても、最小限の適応で本フレームワークを拡張可能か?
  • RQ5既存の最先端の反事実的説明生成手法と比較して、有効性、スパarsity、分布内品質の観点で本手法はどの程度の性能を示すか?

主な発見

  • 本手法は1回の順伝播で反事実的インスタンスを生成し、個々のインスタンスに対する反復的最適化の必要性を排除することでバッチ推論を可能にする。
  • 表形式データにおいて、DiCE や MO などの最先端手法と同等の有効性および分布内品質を達成しており、重複クラス分布においてはMMDスコアが低くなる。
  • 制約付き条件付きベクトルからのサンプリングにより、多様な反事実的説明を生成しながらも高い有効性を維持し、性能低下はわずかに抑えられる。
  • MNIST および CelebA における画像データに対しても、有効で分布内に収束する反事実的説明を成功裏に生成し、表形式データを超えた一般化能力を示した。
  • 訓練中に安定的でロバストであり、最小限のハイパーパrameterチューニングで、複数のデータセットおよびモデルタイプで一貫した性能を示した。
  • 主な指標においてベースラインを上回るか同等の性能を達成した:高い有効性、低いスパarsity、特に重複クラス分布の状況下で有利なMMDスコアを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。