Skip to main content
QUICK REVIEW

[論文レビュー] Learning and Exploiting Multiple Subgoals for Fast Exploration in Hierarchical Reinforcement Learning

Libo Xing|arXiv (Cornell University)|May 13, 2019
Reinforcement Learning in Robotics参考文献 16被引用数 5
ひとこと要約

本論文では、手動で設計しないでデータから学習するピクセル制御、特徴制御、方向制御の3種類のサブゴールを同時に使用することで、スパarsely-rewarded環境における探索効率を向上させるマルチゴール階層強化学習(HRL)アルゴリズムを提案する。この手法は、モンテズマのレヴェンのAtariゲームで最先端の性能を達成しながらも、訓練時間を大幅に短縮し、サブゴールが最適でない場合でさえも収束が速く、頑健であることを示している。

ABSTRACT

Hierarchical Reinforcement Learning (HRL) exploits temporally extended actions, or options, to make decisions from a higher-dimensional perspective to alleviate the sparse reward problem, one of the most challenging problems in reinforcement learning. The majority of existing HRL algorithms require either significant manual design with respect to the specific environment or enormous exploration to automatically learn options from data. To achieve fast exploration without using manual design, we devise a multi-goal HRL algorithm, consisting of a high-level policy Manager and a low-level policy Worker. The Manager provides the Worker multiple subgoals at each time step. Each subgoal corresponds to an option to control the environment. Although the agent may show some confusion at the beginning of training since it is guided by three diverse subgoals, the agent's behavior policy will quickly learn how to respond to multiple subgoals from the high-level controller on different occasions. By exploiting multiple subgoals, the exploration efficiency is significantly improved. We conduct experiments in Atari's Montezuma's Revenge environment, a well-known sparse reward environment, and in doing so achieve the same performance as state-of-the-art HRL methods with substantially reduced training time cost.

研究の動機と目的

  • 報酬が稀で遅延する強化学習の文脈で、エージェントが学習を困難にしているスパースリワードの課題に対処すること。
  • 手動でサブゴールを設計する必要があるか、探索効率が低い既存のHRL手法の限界を克服すること。
  • 環境固有の事前知識を必要とせずに、複数のサブゴールを同時に活用することで、複雑な環境における探索効率を向上させること。
  • 一部のサブゴールが無効であっても、マルチゴールのガイダンスが学習速度と頑健性を向上させることを示すこと。

提案手法

  • ハイレベルなマネージャー方策とローレベルなワーカー方策を持つ二段階のHRLアーキテクチャを導入し、マネージャーが1時刻ごとに複数のサブゴールを生成する。
  • 3種類のサブゴールを定義:ピクセル制御(特定のピクセルを操作)、特徴制御(学習された視覚的特徴を制御)、方向制御(移動方向を制御)、これらすべてがデータから学習される。
  • 複数のサブゴールからのインセンティブ報酬を用いてワーカー方策を訓練し、並列で多様な行動を学習可能にする。
  • マネージャーにおける各サブゴールに対して独立したアクターキャッチャー・ネットワークを用い、同じ訓練データストリームを共有しながらも独立した最適化を可能にする。
  • ワーカーを1つのサブゴールではなく、複数のサブゴールを同時にガイドすることで、方策学習を加速するマルチゴール探索戦略を適用する。
  • サブゴールが一般化可能で環境に依存しないように設計し、手動による設計依存を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ11つのサブゴールHRLと比較して、複数のデータから学習したサブゴールを同時に使用することで、スパースリワード環境における探索効率が向上するか?
  • RQ2モンテズマのレヴェンのような環境において、マルチゴールHRLエージェントの性能は、最先端のHRLおよび非階層的RL手法と比較してどうなるか?
  • RQ3無効またはランダムなサブゴールが含まれた場合でも、提案されたマルチゴールフレームワークは頑健か?
  • RQ4サブゴールの数が学習速度および最終的な性能に与える影響はどの程度か?

主な発見

  • モンテズマのレヴェンにおいて、提案されたマルチゴールHRLエージェントは、最先端のHRL手法と同等の最大スコアを達成したが、訓練時間が著しく短縮されており、優れた探索効率を示している。
  • アライアン環境では、3つのサブゴールを持つエージェントが、同じ訓練ステップ数内でFuNおよび特徴制御エージェントのほぼ2倍のスコアを達成した。
  • サブゴールを3つから1つに減らした場合、特にモンテズマのレヴェンにおいて、訓練効率が著しく低下した。これはマルチゴール設定の必要性を確認している。
  • ランダム(劣悪な)サブゴールを含めても、性能の低下はわずかに抑えられ、アルゴリズムが無効なサブゴールに対しても頑健であることを示している。
  • フロストバイトでは、3つのサブゴールを持つエージェントはオプション・クリティックおよび特徴制御エージェントと同等の性能を達成したが、FuNほどは良くない。これは、複数環境にわたる強力な一般化能力を示している。
  • 非階層的Ape-Xよりもスパースリワード設定で優れた性能を示しており、マルチゴールガイダンスを備えた階層的構造の利点を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。