Skip to main content
QUICK REVIEW

[論文レビュー] InfoRL: Interpretable Reinforcement Learning using Information Maximization

Aadil Hayat, Utsav Singh|arXiv (Cornell University)|May 24, 2019
Explainable Artificial Intelligence (XAI)被引用数 6
ひとこと要約

InfoRLは、情報最大化を用いて、タスクに対して複数の近似的に最適な方策を発見・分離する強化学習フレームワークを提案する。潜在変数と方策出力の相互情報量を最大化することで、教師なしに多様でタスクを遂行可能な行動をサンプリング可能となり、連続的および離散的潜在空間における異なる戦略に対する分離可能な制御を実現する。

ABSTRACT

Recent advances in reinforcement learning have proved that given an environment we can learn to perform a task in that environment if we have access to some form of a reward function (dense, sparse or derived from IRL). But most of the algorithms focus on learning a single best policy to perform a given set of tasks. In this paper, we focus on an algorithm that learns to not just perform a task but different ways to perform the same task. As we know when the environment is complex enough there always exists multiple ways to perform a task. We show that using the concept of information maximization it is possible to learn latent codes for discovering multiple ways to perform any given task in an environment.

研究の動機と目的

  • 強化学習エージェントがタスクを実行する複数の近似的に最適な方法を発見・制御できるようにすること。
  • 明確に区別できる解釈可能な方策に対応する分離可能な潜在表現を学習すること。
  • 報酬設計や人間の監視を必要とせず、方策の多様性を無教師で得られる手法を提供すること。
  • 複数の行動戦略を通じて強化学習エージェントが目標を達成する仕組みを解釈可能に理解できるようにすること。
  • 潜在変数のサンプリングによって特定のタスク解決戦略を制御できること。

提案手法

  • InfoRLは、環境の状態と潜在変数の両方に条件付けられたPPOベースの方策ネットワークを用い、多様な行動を出力する。
  • 事後分布ネットワークは、状態と予測された行動から元のサンプルされた潜在変数を推定し、相互情報量の最大化を可能にする。
  • 報酬信号は環境報酬と事後分布ネットワークからの再構成誤差を組み合わせており、潜在変数がタスク解決に必要な情報を保持するよう促進する。
  • 対照的学習を用いた情報最大化により、異なる方策に対応する潜在変数を分離する。
  • 潜在変数は連続的(例:速度、方向)またはカテゴリカル(例:目的位置)にモデル化され、多様な行動モードを捉える。
  • フレームワークは教師なしでエンドツーエンドに訓練され、人間によるデモンストレーションや報酬設計を一切不要とする。

実験結果

リサーチクエスチョン

  • RQ1情報最大化を用いることで、強化学習において1つのタスクに対して複数の明確に異なる近似的に最適な方策を発見できるか?
  • RQ21つの潜在変数が、ロボット環境における速度、方向、目的到達など、異なる行動戦略を分離・制御できるか?
  • RQ3潜在変数と方策出力の間の相互情報量を最大化することで、解釈可能で多様な方策行動が得られるか?
  • RQ4この手法は報酬設計や人間の監視なしに無教師設定で適用可能か?
  • RQ5学習された潜在変数は、異なる環境において特定のタスク解決戦略とどの程度相関しているか?

主な発見

  • InfoRLはWalker2dSpeed-v1およびHumanoidSpeed-v1において、速度が潜在変数に単調に依存する連続的潜在変数を成功裏に分離し、速度制御を実現した。
  • AntDirection-v1環境では、潜在変数を変化させることで明確に異なる方向性の軌道が得られ、潜在変数の範囲全体にわたり明確な方向制御が観察された。
  • マルチゴール到達環境(FetchTwoGoalReachDense-v1など)では、カテゴリカルな潜在変数が到達目的と強く相関しており、混同行列における高い正確性が示された。
  • 単に潜在変数を変更することで、再訓練なしに多様でタスクを遂行可能な方策をサンプリング可能であり、異なる戦略に対する制御を実証した。
  • 事後分布ネットワークは正確に元の潜在変数を再構成できており、潜在変数が方策行動に関する意味のある情報を保持していることを確認した。
  • 本手法は環境間で一般化可能であり、連続的および離散的潜在空間の両方をサポートしており、堅牢性と解釈可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。