Skip to main content
QUICK REVIEW

[論文レビュー] Distal Explanations for Model-free Explainable Reinforcement Learning

Prashan Madumal, Tim Miller|arXiv (Cornell University)|Jan 28, 2020
Explainable Artificial Intelligence (XAI)参考文献 44被引用数 6
ひとこと要約

本論文は、モデルフリー強化学習エージェントのための遠隔説明モデルを提案し、意思決定ツリーと因果モデルを用いて、『なぜ』と『なぜでない』の説明を生成するための機会連鎖(AがBを可能にし、BがCを引き起こす)を学習する。タスク予測精度と反事後的推論の正確性が向上し、3つのシナリオで90名の参加者が参加した人間による研究で、2つのベースラインを上回った。

ABSTRACT

In this paper we introduce and evaluate a distal explanation model for model-free reinforcement learning agents that can generate explanations for `why' and `why not' questions. Our starting point is the observation that causal models can generate opportunity chains that take the form of `A enables B and B causes C'. Using insights from an analysis of 240 explanations generated in a human-agent experiment, we define a distal explanation model that can analyse counterfactuals and opportunity chains using decision trees and causal models. A recurrent neural network is employed to learn opportunity chains, and decision trees are used to improve the accuracy of task prediction and the generated counterfactuals. We computationally evaluate the model in 6 reinforcement learning benchmarks using different reinforcement learning algorithms. From a study with 90 human participants, we show that our distal explanation model results in improved outcomes over three scenarios compared with two baseline explanation models.

研究の動機と目的

  • 強化学習エージェントのための説明モデルを開発し、因果的推論を用いて『なぜ』と『なぜでない』の質問に応えること。
  • 既存の行動影響モデルの限界を克服し、説明に将来依存する行動(遠隔行動)を統合すること。
  • 人間の認知的パターンに根ざした説明モデルを構築するため、人間エージェント研究から得られた240件の説明を分析すること。
  • 意思決定ツリーと因果的連鎖の統合により、タスク予測精度と説明品質を向上させること。
  • 6つの強化学習ベンチマークと、3つのカスタムStarCraft IIシナリオにおける人間研究を通じて、モデルを評価すること。

提案手法

  • モデルは再帰的ニューラルネットワークを用いて、エージェント行動から機会連鎖を学習し、行動間の因果的依存関係を捉える。
  • 意思決定ツリーを訓練してエージェントの方針を表現し、行動の依存関係をモデル化することでタスク予測精度を向上させる。
  • 行動影響グラフから導出された因果モデルを用いて、機会連鎖(AがBを可能にし、BがCを引き起こす)の抽出と検証を行う。
  • 現在の行動を変更し、その結果生じる機会連鎖内の変化を追跡することで、反事後的説明を生成する。
  • 意思決定ツリーの予測と因果的連鎖を統合し、説明品質とタスク予測パフォーマンスの両方を最適化する。
  • 3つのカスタムStarCraft IIシナリオにおける90名の参加者を対象とした人間研究を通じて、説明品質とタスク予測精度を評価する。

実験結果

リサーチクエスチョン

  • RQ1人間は共同的強化学習環境において、エージェント行動をどのように自然に説明するか?
  • RQ2人間の説明は、即時の行動よりも、将来に依存する行動(遠隔行動)にどれほど依存しているか?
  • RQ3機会連鎖(AがBを可能にし、BがCを引き起こす)を学習するモデルは、強化学習におけるタスク予測精度と説明品質を向上させることができるか?
  • RQ4人間評価において、遠隔説明モデルは行動ベースおよび状態-行動ベースのベースラインと比較してどのように差をつけるか?
  • RQ5事前のドメイン知識(例:ゲーム経験)は、人間がエージェントの説明を理解する上でどのような影響を及ぼすか?

主な発見

  • 人間エージェント研究において、240件の説明の多くが、現在の行動に依存する将来の行動を頻繁に参照しており、機会連鎖の存在が裏付けられた。
  • 人間研究において、遠隔説明モデルは、タスク予測精度と説明品質の両面で2つのベースラインモデルを顕著に上回った。
  • 参加者たちは、遠隔説明をより直感的で情報量が多く、特に複雑な共同作業シナリオにおいて好意的に評価した。
  • StarCraft II経験とタスク予測スコアとの間に有意な相関は認められなかった(p = 0.133)ため、モデルの有効性がドメイン固有のゲーム知識に依存しないことが示唆された。
  • モデルのパフォーマンスは、下位の因果グラフの正確性に敏感であることが判明し、ドメインにおける正確な因果構造の必要性が強調された。
  • 遠隔説明—すなわち、行動の可能化関係や因果関係に焦点を当てた説明—が、人間とエージェントの協働成果を向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。