Skip to main content
QUICK REVIEW

[論文レビュー] Counterfactual Explanations in Sequential Decision Making Under Uncertainty

Stratis Tsirtsis, Abir De|arXiv (Cornell University)|Jul 6, 2021
Explainable Artificial Intelligence (XAI)参考文献 35被引用数 5
ひとこと要約

本稿は、有限horizonのマルコフ決定過程とGumbel-Max構造的因果モデルを用いて、不確実性下における順序的意思決定における対向的説明を生成するための新規フレームワークを提案する。最大 $k$ 個の行動を変更することで、観測されたシーケンスから逸脱するが、最適な対向的ポリシーを計算する多項式時間の動的計画法アルゴリズムを提案。合成データおよび実臨床の認知行動療法データを用いた検証により、臨床的に意味のある洞察を示した。

ABSTRACT

Methods to find counterfactual explanations have predominantly focused on one step decision making processes. In this work, we initiate the development of methods to find counterfactual explanations for decision making processes in which multiple, dependent actions are taken sequentially over time. We start by formally characterizing a sequence of actions and states using finite horizon Markov decision processes and the Gumbel-Max structural causal model. Building upon this characterization, we formally state the problem of finding counterfactual explanations for sequential decision making processes. In our problem formulation, the counterfactual explanation specifies an alternative sequence of actions differing in at most k actions from the observed sequence that could have led the observed process realization to a better outcome. Then, we introduce a polynomial time algorithm based on dynamic programming to build a counterfactual policy that is guaranteed to always provide the optimal counterfactual explanation on every possible realization of the counterfactual environment dynamics. We validate our algorithm using both synthetic and real data from cognitive behavioral therapy and show that the counterfactual explanations our algorithm finds can provide valuable insights to enhance sequential decision making under uncertainty.

研究の動機と目的

  • 行動が相互に依存する順序的・多段階的意思決定プロセスにおける、対向的説明のギャップを埋める。
  • 観測シーケンスと最大 $k$ 個の行動で異なる行動シーケンスの集合として、対向的説明を制約付き探索として形式化する。
  • すべての対向的ダイナミクスの実現の下で最適な対向的結果を保証する、スケーラブルで多項式時間のアルゴリズムを開発する。
  • 実世界の臨床データを用いて手法を検証し、実行可能で臨床的に解釈可能な洞察を示す。
  • 後向き分析のための因果的・干渉ベースの説明フレームワークを提供する。

提案手法

  • 離散的かつ低次元の状態空間と行動空間を持つ有限horizonのマルコフ決定過程(MDP)を用いて、順序的意思決定を形式化する。
  • 遷移確率をGumbel-Max構造的因果モデルでモデル化し、対向的安定性と信頼性の高い結果推定を確保する。
  • 対向的説明問題を、観測シーケンスと最大 $k$ 個の行動で異なる代替行動シーケンスの集合としての制約付き探索として定義する。
  • 対向的遷移ダイナミクスのすべての実現に対して最適な結果を保証する動的計画法に基づくアルゴリズムを開発する。
  • 複数の対向的実現をサンプリングするポリシー評価メカニズムを採用し、結果の改善を評価し、干渉に適した時間ステップを同定する。
  • アルゴリズム的サンプリングを用いて、対向的実現全体にわたって一貫した行動変更(例:認知再構成を行動活性化に置き換え)を同定する。

実験結果

リサーチクエスチョン

  • RQ1複数の相互依存する行動を含む順序的意思決定プロセスに、対向的説明を意味的に拡張できるか?
  • RQ2不確実性下で最適な結果を保証する形で、対向的説明を形式的に定義・計算する方法は何か?
  • RQ3観測経路と最大 $k$ 個の行動で異なる最適な対向的行動シーケンスを求める計算量の複雑さは何か?
  • RQ4提案手法から得られる対向的説明は、実世界の順序的意思決定プロセスにおける観測結果とどのように比較できるか?
  • RQ5異なる実現において、最適な対向的ポリシーが最も頻繁に推奨する時間ステップと行動変更は何か?

主な発見

  • うつ病の進行傾向を示す患者に対して、$k=3$ の最適な対向的ポリシーは、観測結果と比較して平均で9.5%の結果改善を達成した。
  • サンプリングされた対向的実現の85%において、結果が観測結果を上回った。これは、提案された行動変更により改善の確率が非常に高いことを示している。
  • 時間ステップ $t=10$、$t=13$、$t=16$ が対向的説明において過剰に代表されており、$t=10$ が臨床的悪化の開始を示している。
  • 最適なポリシーは一貫して、悪化期の開始時に認知再構成(CRT)を行動活性化(BHA)に置き換えることを推奨し、これは精神保健専門家から臨床的に妥当であると評価された。
  • 最もパフォーマンスの優れた対向的実現では、悪化傾向が大きく回避された。これは、本手法が否定的結果の回避に有効である可能性を示している。
  • 本手法は、臨床的最良実践と整合する実行可能で解釈可能な治療シーケンスの変更を同定し、実世界応用における信頼性と有用性を高めた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。