Skip to main content
QUICK REVIEW

[論文レビュー] Learning Actionable Representations with Goal-Conditioned Policies

Dibya Ghosh, Abhishek Gupta|arXiv (Cornell University)|Nov 19, 2018
Reinforcement Learning in Robotics参考文献 29被引用数 7
ひとこと要約

本稿では、観測のすべての変動を捉えるのではなく、意思決定に必要な要因のみを捉える、ゴール条件付き表現学習手法であるActionable Representations for Control (ARC) を提案する。ゴール条件付きポリシーを訓練し、異なるゴールに至るための行動の差異に基づいて表現を抽出することで、動的特性に配慮した機能的表現を学習する。ARCは、シミュレーテッドロボットタスクにおける探索、階層的強化学習、および後続のポリシー学習において、生成的・予測的アプローチを凌駕する性能を示す。

ABSTRACT

Representation learning is a central challenge across a range of machine learning areas. In reinforcement learning, effective and functional representations have the potential to tremendously accelerate learning progress and solve more challenging problems. Most prior work on representation learning has focused on generative approaches, learning representations that capture all underlying factors of variation in the observation space in a more disentangled or well-ordered manner. In this paper, we instead aim to learn functionally salient representations: representations that are not necessarily complete in terms of capturing all factors of variation in the observation space, but rather aim to capture those factors of variation that are important for decision making -- that are "actionable." These representations are aware of the dynamics of the environment, and capture only the elements of the observation that are necessary for decision making rather than all factors of variation, without explicit reconstruction of the observation. We show how these representations can be useful to improve exploration for sparse reward problems, to enable long horizon hierarchical reinforcement learning, and as a state representation for learning policies for downstream tasks. We evaluate our method on a number of simulated environments, and compare it to prior methods for representation learning, exploration, and hierarchical reinforcement learning.

研究の動機と目的

  • 観測のすべての要因を捉えるのではなく、意思決定に機能的に顕著な要因のみを捉える表現学習の課題に対処すること。
  • 明示的な再構成や完全な状態モデリングを必要とせず、環境の動的特性を暗黙的に符号化する表現学習手法の開発。
  • ゴール条件付きポリシーから得られる表現を用いて、より効率的な探索、階層的強化学習、および後続のポリシー学習を可能にすること。
  • 単一のゴール条件付きポリシーから学習した表現が、複雑で長時間にわたるタスクを再利用可能であることを示すこと。

提案手法

  • オフポリシー強化学習を用いて、任意の初期状態から任意のゴール状態に到達する方法を学ぶゴール条件付きポリシー(GCP)を訓練する。
  • 異なるゴール状態に至るための行動のユークリッド距離を測定することで、行動差異に基づいた行動的表現を抽出し、距離が機能的差異を反映する表現空間を構築する。
  • 行動が異なる状態は互いに遠く、行動が類似する状態は近接するように表現空間を構築し、意思決定に関連する特徴を強調する。
  • 再構成損失を回避し、制御に関連する動的特性に焦点を当てる行動差異に基づく対照的学習目的を用いる。
  • 高レベルのポリシーを階層的強化学習で訓練する際、潜在空間内で直接ゴールを指定するか、表現空間のk-meansクラスタリングを用いることで、ARC表現を活用する。
  • ARCを用いてより良いGCPを訓練することで、繰り返し改善が可能となり、複数のタスクにわたる表現学習コストを低減できる。

実験結果

リサーチクエスチョン

  • RQ1意思決定に関連する要因のみを捉える表現が、生成的・予測的表現に比べて、後続の強化学習タスクで優れた性能を示すか?
  • RQ2ゴール条件付きポリシーから得られる表現は、報酬がスパarsな環境での探索をどのように改善するか?
  • RQ3ARCは、構造的で動的特性に配慮した潜在空間を提供することで、より効果的な階層的強化学習を可能にするか?
  • RQ4ARCを用いることで、最先端の手法と比較して、複雑で長時間にわたるタスクの学習がより速く、よりサンプル効率的に可能になるか?
  • RQ5同じ表現を複数の後続タスクに再利用可能で、表現学習コストを低減できるか?

主な発見

  • ARCは、後続のポリシー学習、探索、階層的強化学習タスクにおいて、生成的・予測的表現学習手法を顕著に上回る性能を示す。
  • 複数の部屋を含むナビゲーションタスクやウェイポイントタスクでは、ARCに基づく階層的ポリシーがOption-Critic、HIRO、TRPOを上回り、それらは進捗を示さない。
  • ARC表現は明確で意味的に意味のあるクラスタを形成する(例:異なる部屋がまとまる)ため、効果的な高レベル計画が可能となり、行動空間の冗長性が低減される。
  • 意味的に類似した状態が近くに位置する構造的で動的特性に配慮した潜在空間を提供することで、効果的な階層的制御が可能となり、探索の効率が向上する。
  • 1つの事前学習済みゴール条件付きポリシーを再利用することで、複雑なタスクの学習がより速く可能となり、表現学習のコスト低減効果が実証された。
  • 同じデータを用いても、モデルベースのMPCや他のベースラインを上回る性能を示しており、汎用的状態表現よりも機能的に顕著な表現の優位性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。