Skip to main content
QUICK REVIEW

[論文レビュー] A Survey on Interpretable Reinforcement Learning

Claire Glanois, Paul Weng|arXiv (Cornell University)|Dec 24, 2021
Explainable Artificial Intelligence (XAI)被引用数 15
ひとこと要約

本サーベイは、解釈可能強化学習(IRL)の包括的概要を提供し、解釈可能な入力、解釈可能な遷移/報酬モデル、解釈可能な意思決定の3つにアプローチを分類する。解釈可能性を事後的説明とは対照的に、インダクティブバイアスとして強調し、2013年から2021年の最近の進展をレビューし、スケーラビリティ、評価、パフォーマンスとのトレードオフといった主な課題を特定する。

ABSTRACT

Although deep reinforcement learning has become a promising machine learning approach for sequential decision-making problems, it is still not mature enough for high-stake domains such as autonomous driving or medical applications. In such contexts, a learned policy needs for instance to be interpretable, so that it can be inspected before any deployment (e.g., for safety and verifiability reasons). This survey provides an overview of various approaches to achieve higher interpretability in reinforcement learning (RL). To that aim, we distinguish interpretability (as a property of a model) and explainability (as a post-hoc operation, with the intervention of a proxy) and discuss them in the context of RL with an emphasis on the former notion. In particular, we argue that interpretable RL may embrace different facets: interpretable inputs, interpretable (transition/reward) models, and interpretable decision-making. Based on this scheme, we summarize and analyze recent work related to interpretable RL with an emphasis on papers published in the past 10 years. We also discuss briefly some related research areas and point to some potential promising research directions.

研究の動機と目的

  • 医療や自動運転などのハイリスク分野への適用を可能にするために、深層強化学習(DRL)における解釈可能性の重要性に対応する。
  • 解釈可能性(モデルの性質としてのもの)と説明可能性(事後的処理としてのもの)を区別し、強化学習における解釈可能性を設計原則として重視する。
  • 解釈可能な入力、解釈可能な遷移および好みモデル、解釈可能な意思決定の3軸に沿って、最近のIRL手法を体系的に分類・分析する。
  • 解釈可能性を一般化性、データ効率性、耐性の向上に寄与する正則化手法としての役割を強調する。
  • 評価指標、スケーラビリティ、解釈可能性とパフォーマンスのトレードオフといった、未解決の問題を特定する。

提案手法

  • 入力、遷移/報酬モデル、意思決定方策の3要素に基づく解釈可能RLの分類法を提案する。
  • 構造的表現、記号的学習、階層的強化学習を用いる手法を調査し、入力の解釈可能性を向上させる。
  • 神経的記号的手法を用いた解釈可能な遷移モデルの学習法や、報酬形状に用いる好みモデルの学習法を検討する。
  • アーキテクチャのインダクティブバイアス(例:アテンション機構、グラフネットワーク)と知的解釈性を目的とした正則化をレビューし、方策に直接解釈可能性を組み込む。
  • 直接的(例:記号的方策)と間接的(例:モジュール型または階層的)な方策解釈可能性のアプローチを区別する。
  • 事後的説明手法についても短い議論を含めるが、焦点は内在的解釈可能性に置かれる。

実験結果

リサーチクエスチョン

  • RQ1強化学習の文脈において、解釈可能性を体系的に定義し、説明可能性とどのように区別できるか。
  • RQ2強化学習における解釈可能な入力を達成する主な手法的アプローチは何か。それらはモデルの透明性をどのように向上させるか。
  • RQ3解釈可能な遷移および好みモデルは、モデルベース強化学習の透明性と信頼性をどの程度向上できるか。
  • RQ4解釈可能な意思決定方策を設計するための、最も効果的なアーキテクチャ的バイアスおよび正則化手法は何か。
  • RQ5解釈可能性の評価およびスケーラビリティとパフォーマンスのバランスをとる上で、主な未解決課題は何か。

主な発見

  • 解釈可能強化学習は、安全性、責任性、信頼性といった倫理的・法的・運用的懸念から、ハイリスク分野において不可欠である。
  • 記号的または構造的表現といった解釈可能な入力は、モデルの透明性を向上させ、誤った特徴に依存するのを減らすことができる。
  • 解釈可能な遷移および好みモデルの学習は、モデルベース強化学習における検証・デバッグ・一般化性の向上に寄与する。
  • アーキテクチャ的インダクティブバイアスと知的解釈性を目的とした正則化は、方策に直接解釈可能性を組み込むことができ、データ効率性と耐性の向上に寄与する。
  • 完全に解釈可能な方策(例:プログラム風)はしばしばNP困難に陥るため、解釈可能性とスケーラビリティの間に顕著なトレードオフが存在する。
  • 解釈可能性や説明可能性のための標準化された評価指標は存在せず、分野の比較的分析や進展を妨げている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。