Skip to main content
QUICK REVIEW

[論文レビュー] Learning Goal Embeddings via Self-Play for Hierarchical Reinforcement Learning

Sainbayar Sukhbaatar, Emily Denton|arXiv (Cornell University)|Nov 22, 2018
Reinforcement Learning in Robotics参考文献 18被引用数 15
ひとこと要約

本稿では、階層強化学習における連続的ゴール埋め込みと低レベル方策の学習を目的とした教師なし自己対戦フレームワークを提案する。このフレームワークにより、高レベル方策が部分ゴールベクトルを用いてエージェントを誘導できるようになる。本手法は、敵対的ゴール生成を通じて分離可能で空間的に意味のあるゴール表現を学習することで、AntGatherのような複雑なタスクにおいて、非階層的ベースラインを上回る優れた性能を達成した。

ABSTRACT

In hierarchical reinforcement learning a major challenge is determining appropriate low-level policies. We propose an unsupervised learning scheme, based on asymmetric self-play from Sukhbaatar et al. (2018), that automatically learns a good representation of sub-goals in the environment and a low-level policy that can execute them. A high-level policy can then direct the lower one by generating a sequence of continuous sub-goal vectors. We evaluate our model using Mazebase and Mujoco environments, including the challenging AntGather task. Visualizations of the sub-goal embeddings reveal a logical decomposition of tasks within the environment. Quantitatively, our approach obtains compelling performance gains over non-hierarchical approaches.

研究の動機と目的

  • 教師なしの環境下で、効果的で汎用的な低レベル方策および部分ゴール表現を学習する課題に対処すること。
  • 制御可能な環境ダイナミクスを捉える連続的ゴールベクトルを用いて、高レベル方策がエージェントを誘導できることを実現すること。
  • 教師なし非対称的自己対戦による事前学習を通じて、サンプル効率を向上させ、スパarsely報酬が与えられる環境における性能を向上させること。
  • 不要な環境的詳細を抽象化しながら、部分ゴールの識別可能性と達成可能性を保つゴール埋め込み空間を学習すること。

提案手法

  • Bob(低レベルエージェント)を非対称的自己対戦により事前学習し、ゴールベクトルを生成して自ら課したタスクを試みる。
  • 現在の状態とゴールベクトルの両方を入力として受け取るゴール条件付き方策ネットワークを用いて、低レベル行動を誘導する。
  • 第二のエージェント(Alice)が多様で挑戦的なタスクを提示することで、方策の崩壊を防ぎ、探索を促進する敵対的報酬構造を活用する。
  • 各行動が50ステップのホライズンに対応するように、スパarsely報酬を用いて高レベル方策(Charlie)を訓練する。
  • 自己対戦中に、制御可能な状態次元(例:Antのx-y位置)に焦点を当てた距離ベースの成功指標(D)を用いる。これは、高さや関節角度といった関係のない変数を抽象化する。
  • ゴール提案方策にエントロピー正則化を適用し、ゴール空間の多様性を維持し、退化した解を避ける。

実験結果

リサーチクエスチョン

  • RQ1教師なし自己対戦は、多様で制御可能な低レベル行動をサポートする汎用的で連続的なゴール埋め込み空間を効果的に学習できるか?
  • RQ2自己対戦による事前学習は、スパarsely報酬環境における階層的強化学習のサンプル効率と性能をどのように向上させるか?
  • RQ3学習されたゴール埋め込み空間は、環境内での意味的で分離可能かつ空間的に一貫性のある部分ゴールをどれほど反映しているか?
  • RQ4高レベル方策は、タスクレベルの報酬しか得られない状況でも、学習済み部分ゴールを組み合わせることで、複雑で長時間にわたるタスクに一般化できるか?

主な発見

  • 提案モデルはAntGatherタスクで平均リターン0.5を達成したが、PPO、REINFORCE、自己対戦などの非階層的ベースラインは正の報酬を学習できなかった。
  • ゴール埋め込みの可視化から、提案されたゴールの実際のXY位置を反映する空間的に一貫性のある構造が確認され、制御可能な環境ダイナミクスの有効な学習が示された。
  • Bobの方策は、自己対戦時(最大0.7ステップ)よりもはるかに長い距離(6ステップ以上)をカバーする未学習のゴールベクトルに一般化できており、強固な一般化能力を示した。
  • ゴール提案の多様性は時間経過とともに増加し、Aliceはエントロピー正則化のおかげで全方向にタスクを生成するよう学習した。
  • 固定されたゴールベクトルに対する軌道は、一貫した方向への移動を示し、ゴール埋め込みが正確な制御を可能にしていることを確認した。
  • ゴール埋め込み空間は、不要な状態次元(例:高さ、関節角度)を抽象化し、環境の制御可能な側面にのみ焦点を当てていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。