[論文レビュー] A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges
本調査では、説明可能な強化学習(XRL)のための統一的分類体系を提示し、手法をエージェントモデルの説明、報酬の説明、状態の説明、タスクの説明の4つに分類する。人間の知識が学習効率を向上させる役割を強調し、評価、マルチパーツの説明可能性、パフォーマンスと説明可能性のバランスといった主な課題を特定する。
Reinforcement Learning (RL) is a popular machine learning paradigm where intelligent agents interact with the environment to fulfill a long-term goal. Driven by the resurgence of deep learning, Deep RL (DRL) has witnessed great success over a wide spectrum of complex control tasks. Despite the encouraging results achieved, the deep neural network-based backbone is widely deemed as a black box that impedes practitioners to trust and employ trained agents in realistic scenarios where high security and reliability are essential. To alleviate this issue, a large volume of literature devoted to shedding light on the inner workings of the intelligent agents has been proposed, by constructing intrinsic interpretability or post-hoc explainability. In this survey, we provide a comprehensive review of existing works on eXplainable RL (XRL) and introduce a new taxonomy where prior works are clearly categorized into model-explaining, reward-explaining, state-explaining, and task-explaining methods. We also review and highlight RL methods that conversely leverage human knowledge to promote learning efficiency and performance of agents while this kind of method is often ignored in XRL field. Some challenges and opportunities in XRL are discussed. This survey intends to provide a high-level summarization of XRL and to motivate future research on more effective XRL solutions. Corresponding open source codes are collected and categorized at https://github.com/Plankson/awesome-explainable-reinforcement-learning.
研究の動機と目的
- 安全性が求められる応用分野において、深層強化学習(DRL)エージェントのブラックボックス性に起因する透明性の欠如を是正すること。
- 既存のXRL手法を、強化学習プロセスのどの部分を説明するか(エージェントモデル、報酬、状態、タスク)に応じて分類する統一的分類体系を確立すること。
- 学習効率とパフォーマンスの向上に寄与するが、従来の調査で軽視されがちな、人間の知識を活用するXRLアプローチを強調すること。
- 評価の標準化、マルチパーツの説明可能性、説明可能性と学習効果のバランスといった、XRLにおける主な課題を特定すること。
- 今後の研究開発を支援するため、XRLツールおよび手法のキュレート済みオープンソースリソースを提供すること。
提案手法
- 4本の分類体系(エージェントモデルの説明、報酬の説明、状態の説明、タスクの説明)を提唱。例:解釈可能なモデル(決定木など)を用いたエージェントモデルの説明、解釈性を高めるために報酬関数を正則化する報酬の説明、観測の解釈に注目マップを用いる状態の説明、階層的タスク分解を用いたタスクの説明。
- 後処理による説明技術(例:セマンティックマップ)と内生的解釈性(例:スパースモデル)を統合するフレームワークを導入し、透明性を向上させる。
- 報酬設計や報酬モデリングなどの人間の知識を学習プロセスに組み込む手法をレビューし、パフォーマンスと説明可能性の両方を向上させる。
- モデルの複雑さ、パフォーマンス、説明可能性のトレードオフを分析し、性能を損なわずに高い解釈性を維持するため、スパースまたは制約付きモデルの使用を提唱する。
- 複数の説明タイプ(例:グローバル戦略要約とローカルセマンティックマップの統合)を統合することで、包括的かつマルチパーツの説明可能性を達成する。
- https://github.com/Plankson/awesome-explainable-reinforcement-learning に、再現性とコミュニティ利用を目的としたオープンソースXRL実装の分類と収集を実施。
実験結果
リサーチクエスチョン
- RQ1XRL手法を、強化学習パイプラインのどのコンponentを説明するかに応じて、体系的に分類する方法は何か?
- RQ2XRL手法の評価における主な課題は何か?標準化されたベンチマークを確立するにはどうすればよいか?
- RQ3人間の知識を、強化学習エージェントの学習効率と説明可能性の両面で向上させるために、どの程度活用できるか?
- RQ4全体の強化学習プロセスにわたる包括的透明性を実現するため、マルチパーツの説明可能性をどのように達成できるか?
- RQ5高いモデルパフォーマンスと高い説明可能性の間には、実現可能なバランスがあるのか、それとも根本的なトレードオフがあるのか?
主な発見
- 本調査では、XRLのための新規4分類分類体系(エージェントモデル、報酬、状態、タスクの説明)を確立し、既存手法の分類に役立つ構造的フレームワークを提供する。
- 報酬設計や人間が関与する学習(人間がループに参加する訓練)といった、人間の知識を活用する多くのXRL手法は、従来の調査で軽視されてきたが、学習効率と解釈性の向上に不可欠である。
- 状態の説明には、セマンティックマップや注目ベースの説明といった、後処理による説明技術が広く用いられる一方、エージェントモデルの説明には、スパースモデルや決定木といった内生的メソッドが有効である。
- パフォーマンスと説明可能性の間に本質的トレードオフは存在しない。線形モデルや決定木といった単純で解釈性の高いモデルは、強力なパフォーマンスを発揮しながらも、透明性を保つことができる。
- 複数の説明タイプ(例:グローバル戦略要約とローカルセマンティックマップ)の統合は、包括的かつマルチパーツの説明可能性を実現する有望な道筋を示している。
- 標準化された評価指標の欠如が大きな課題であり、自己走行車シナリオにおけるXRLの比較的評価フレームワークを提案したのは、Shenら(2021年)の研究のみにとどまっている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。