Skip to main content
QUICK REVIEW

[論文レビュー] Landmark-Guided Subgoal Generation in Hierarchical Reinforcement Learning

Junsu Kim, Younggyo Seo|arXiv (Cornell University)|Oct 26, 2021
Reinforcement Learning in Robotics参考文献 52被引用数 19
ひとこと要約

本論文では、カバレッジとノベルティ基準に基づいて選択された、情報性の高い状態(ランドマーク)を用いて部分目標生成を誘導することで、探索効率を向上させる階層的強化学習フレームワークHIGLを提案する。ランドマークに基づくグラフを構築し、ゴールへの最短経路における最近傍ランドマークを選択することで、ハイレベルポリシーの行動空間を縮小し、長時間スパンの制御タスクにおいて優れた性能を達成した。特に、スパarsな報酬設定下でAnt Mazeタスクにおいて65.1%の成功率を達成し、HRACの17.6%を大きく上回った。

ABSTRACT

Goal-conditioned hierarchical reinforcement learning (HRL) has shown promising results for solving complex and long-horizon RL tasks. However, the action space of high-level policy in the goal-conditioned HRL is often large, so it results in poor exploration, leading to inefficiency in training. In this paper, we present HIerarchical reinforcement learning Guided by Landmarks (HIGL), a novel framework for training a high-level policy with a reduced action space guided by landmarks, i.e., promising states to explore. The key component of HIGL is twofold: (a) sampling landmarks that are informative for exploration and (b) encouraging the high-level policy to generate a subgoal towards a selected landmark. For (a), we consider two criteria: coverage of the entire visited state space (i.e., dispersion of states) and novelty of states (i.e., prediction error of a state). For (b), we select a landmark as the very first landmark in the shortest path in a graph whose nodes are landmarks. Our experiments demonstrate that our framework outperforms prior-arts across a variety of control tasks, thanks to efficient exploration guided by landmarks.

研究の動機と目的

  • 大規模なハイレベル行動空間が原因で、ゴール条件付き階層的強化学習における探索が不十分になるという課題に対処すること。
  • スパース報酬を伴う長時間スパンの連続制御タスクにおける、サンプル効率と学習性能の向上を図ること。
  • 有望で情報性の高い状態(ランドマーク)に焦点を当てることで、ハイレベルポリシーの行動空間を縮小する手法の開発。
  • カバレッジと予測誤差に基づく多様性とノベルティを兼ね備えたランドマークへ部分目標生成を誘導することで、探索を強化すること。
  • ドメイン特化の知識や事前定義された部分目標空間に依存せずに、スケーラブルかつ効果的な部分目標発見を可能にすること。

提案手法

  • ランドマークは2つの基準を用いてサンプリングされる:(a) 通行状態の空間的分散を最大化するカバレッジベースのサンプリング、(b) ステートオートエンコーダの予測誤差を用いたノベルティベースのサンプリング(めったに見られないまたは未探索の状態を同定)。
  • ランドマーク、現在の状態、ゴールをノードとするランドマークグラフを構築し、最短経路計画により最も緊急度の高いランドマークを同定する。
  • ハイレベルポリシーは、選択されたランドマークに向けて部分目標を生成するように訓練され、到達可能で有望な方向への行動空間の縮小が実現される。
  • ランドマーク選択プロセスでは、現在の状態からゴールへの最短経路における最初のランドマークを、ランドマークグラフ上でダイクストラ法を用いて特定する。
  • 本フレームワークは、既存のゴール条件付きHRLアーキテクチャと統合可能であり、同じ低レベルポリシーと報酬形状を用いるが、ハイレベルポリシーの行動空間と学習目的のみを変更する。
  • 本手法は訓練時のみに動作し、推論時には計画のオーバーヘッドが生じないため、デプロイの効率性が保たれる。

実験結果

リサーチクエスチョン

  • RQ1ランドマークに基づく部分目標誘導は、長時間スパンのタスクにおけるハイレベルポリシーの行動空間を縮小しつつ、探索効率を向上させることができるか?
  • RQ2カバレッジベースとノベルティベースのランドマークサンプリング方式は、多様で効果的な探索を促進する点で、どのように比較されるか?
  • RQ3ゴールへの最短経路における最近傍ランドマークを選択することは、一様サンプリングやk近傍領域法と比較して、収束速度と成功確率の向上に寄与するか?
  • RQ4HIGLは、特に探索が困難なスパース報酬環境において、性能をどの程度向上させるか?
  • RQ5画像ベースの観測のような高次元状態空間に対しても、ランドマーク誘導型部分目標生成は効果的にスケーリング可能か?

主な発見

  • HIGLは、スパース報酬設定下のAnt Maze(スパース)環境で65.1%の成功率を達成し、同じ条件下でHRACの17.6%を大きく上回った。
  • Ant Maze(U字型、密度あり)環境では、HIGLが優れたサンプル効率を示し、カバレッジベースランドマークは訪問済み領域に広く分散し、ノベルティベースランドマークは探索のフロンティアに集中していた。
  • カバレッジとノベルティベースのランドマークサンプリングの組み合わせにより、より効果的な探索が実現され、広範な状態空間カバレッジと高速な収束が裏付けられた。
  • HIGLは、有望で到達可能なランドマークに焦点を当てることで、ハイレベルポリシーの行動空間を縮小し、より的を射た部分目標生成を可能にした。
  • HRACと比較して13時間(100万ステップ)の訓練時間が必要であったが、特にスパース報酬環境下で改善されたサンプル効率と性能から、計画コストは正当化された。
  • 本フレームワークは、複数のMuJoCoベースの長時間スパン制御タスクにわたる一般化性能を示し、そのロバストネスとスケーラビリティを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。