Skip to main content
QUICK REVIEW

[論文レビュー] Explainable Reinforcement Learning via Model Transforms

Mira Finkelstein, Lucy Liu|arXiv (Cornell University)|Sep 24, 2022
Explainable Artificial Intelligence (XAI)被引用数 7
ひとこと要約

本稿は、形式的マルコフ決定過程(MDP)変換を用いて、エージェントの実際の行動と観察者の期待との乖離を人間が理解可能な説明として生成する、説明可能な強化学習(XRL)の新規フレームワークを提案する。環境モデルが不完全であっても、あるいはエージェントがモデルフリーであっても、状態の縮約や結果の緩和といった記号的MDP変換を自動的に探索し、エージェントの方策を予測された行動と一致させる。PRE+CLUSTERのような効率的な探索アルゴリズムを用いることで、高い説明品質を達成する。

ABSTRACT

Understanding emerging behaviors of reinforcement learning (RL) agents may be difficult since such agents are often trained in complex environments using highly complex decision making procedures. This has given rise to a variety of approaches to explainability in RL that aim to reconcile discrepancies that may arise between the behavior of an agent and the behavior that is anticipated by an observer. Most recent approaches have relied either on domain knowledge that may not always be available, on an analysis of the agent's policy, or on an analysis of specific elements of the underlying environment, typically modeled as a Markov Decision Process (MDP). Our key claim is that even if the underlying model is not fully known (e.g., the transition probabilities have not been accurately learned) or is not maintained by the agent (i.e., when using model-free methods), the model can nevertheless be exploited to automatically generate explanations. For this purpose, we suggest using formal MDP abstractions and transforms, previously used in the literature for expediting the search for optimal policies, to automatically produce explanations. Since such transforms are typically based on a symbolic representation of the environment, they can provide meaningful explanations for gaps between the anticipated and actual agent behavior. We formally define the explainability problem, suggest a class of transforms that can be used for explaining emergent behaviors, and suggest methods that enable efficient search for an explanation. We demonstrate the approach on a set of standard benchmarks.

研究の動機と目的

  • 強化学習エージェントの発生的行動を説明する課題に取り組むこと、特に方策が人間の期待と乖離する場合に焦点を当てる。
  • ドメイン固有の知識やニューラルネットワークの事後分析に依存する既存のXRL手法の限界を克服すること。
  • 部分的または近似されたMDPモデルを用いて説明を生成できることを可能とし、モデルフリーRL設定でも有効であるようにすること。
  • エージェントの行動と観察者の期待を一致させる記号的MDP変換を自動で特定するスケーラブルな手法を開発すること。
  • 複雑な環境における説明探索の効率を、プルーニングと方策ブートストラップ技術を用いて向上させること。

提案手法

  • 説明可能性の問題を、エージェント、期待される方策を持つ観察者、部分的MDPモデルにアクセス可能な説明者を含む強化学習方策説明(RLPE)として形式化する。
  • 既存のMDP変換文献(状態空間の縮約、可能性の高い結果の緩和、事前条件の緩和、すべての結果の決定化、削除緩和など)を活用し、環境モデルを記号的に操作する。
  • 個々の行動や変数にパラメータ化された変換を適用し、環境の構造とダイナミクスに基づいて自動的に接地する。
  • 3つの探索戦略を実装する:BASE(ダイクストラに基づく最適探索)、PRE-TRAIN(方策ブートストラップによる探索で焦点を当てた更新)、PRE+CLUSTER(グループ化された変換評価によるプルーニング)。
  • 状態ごとのエージェント方策と期待される方策の整合性を評価するための満足度比を用い、説明の長さを距離測度として使用する。
  • 探索深さを3に制限し、CPUクラスタを用いて評価する。単一およびマルチエージェントベンチマークを対象とし、DQNおよびPPOエージェントを用いる。

実験結果

リサーチクエスチョン

  • RQ1環境モデルが不完全であったりエージェントがモデルフリーであっても、形式的MDP変換を用いて、強化学習エージェントの行動と観察者の期待との乖離を自動的に意味のある説明として生成できるか?
  • RQ2BASE、PRE-TRAIN、PRE+CLUSTERといった異なる探索戦略は、説明品質と計算効率のバランスをどのように果たしているか?
  • RQ3緩和や抽象化といった記号的MDP変換は、標準的なRLベンチマークにおいてエージェントの実際の方策と期待される方策をどの程度まで一致させられるか?
  • RQ4単一エージェントおよびマルチエージェント環境において、複雑さやダイナミクスが異なる条件下で、本手法はどのようにスケーリングするか?
  • RQ5複数の行動に削除緩和を適用するなど、グループ化された変換評価に基づくプルーニングは、説明品質を損なわずに探索時間を著しく短縮できるか?

主な発見

  • PRE+CLUSTERは計算時間と説明品質のバランスが最も優れており、実行時間においてBASEおよびPRE-TRAINを上回りながらも、高い満足度比を維持した。
  • Triangle Tireworldドメインでは、PRE+CLUSTERはBASEより7倍以上速く、満足度比の低下もわずか(最悪ケースで84%の成功率)であった。
  • ドメイン間での満足度比の平均分散は低く(0.03)、異なる環境において一貫した性能を示した。
  • PPOを用いたマルチエージェント設定では、PRE+CLUSTERが最も速い実行時間を達成し、最適手法と比較して方策満足度率が最大10%低下したが、妥当な妥協であった。
  • PRE+CLUSTERにおけるグループ化された変換評価とプルーニングの活用により、個々の変換の探索数が著しく削減され、精度の大幅な損失なしに探索効率が向上した。
  • 遷移ダイナミクスが明示的に定義されていない環境でも、事前条件緩和のための遷移行列を事前に学習することで、説明を効果的に生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。