Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Policy Search via Return-Weighted Density Estimation

Takayuki Osa, Masashi Sugiyama|arXiv (Cornell University)|Nov 28, 2017
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本稿では、報酬加重密度推定を用いた階層的方策探索(HPSDE)を提案する。これは、軌道の報酬加重密度を推定することで、オプション方策の数と位置を自動で同定するモデルフリー手法であり、ハイパーパramータの手動チューニングを必要とせず、報酬関数のモードに対応する複数の明確に異なる grasping/posture 方策を学習する。本手法は、冗長なロボットアームにおける複雑な運動計画において、最先端の手法を上回る性能を発揮する。

ABSTRACT

Learning an optimal policy from a multi-modal reward function is a challenging problem in reinforcement learning (RL). Hierarchical RL (HRL) tackles this problem by learning a hierarchical policy, where multiple option policies are in charge of different strategies corresponding to modes of a reward function and a gating policy selects the best option for a given context. Although HRL has been demonstrated to be promising, current state-of-the-art methods cannot still perform well in complex real-world problems due to the difficulty of identifying modes of the reward function. In this paper, we propose a novel method called hierarchical policy search via return-weighted density estimation (HPSDE), which can efficiently identify the modes through density estimation with return-weighted importance sampling. Our proposed method finds option policies corresponding to the modes of the return function and automatically determines the number and the location of option policies, which significantly reduces the burden of hyper-parameters tuning. Through experiments, we demonstrate that the proposed HPSDE successfully learns option policies corresponding to modes of the return function and that it can be successfully applied to a challenging motion planning problem of a redundant robotic manipulator.

研究の動機と目的

  • 階層的強化学習における多モード報酬関数のモードの数と位置を特定する課題に取り組むこと。
  • 特にオプション方策の数に依存するハイパーパrameterの手動チューニングに依存を減らすこと。これは、既存手法において性能に顕著な影響を与える。
  • 報酬関数の各モードに焦点を当てた、明確に分離されたオプション方策の自動発見を可能にすること。モード間の平均化を回避する。
  • 事前学習や初期化に依存しない、ゲーティング方策とオプション方策を同時に学習する手法の開発。

提案手法

  • HPSDEは、報酬加重密度推定を用いて階層的方策探索を定式化し、混合モデルを用いて報酬分布のモードを同定する。
  • 高報酬領域を強調するために、報酬加重重要度サンプリングを採用し、より正確な密度推定を実現する。
  • EMに類似したアルゴリズムを用いて、報酬加重軌道の尤度を最大化することで、ゲーティング方策とオプション方策を同時に最適化する。
  • オプション方策は、既存のポリシー探索手法(例:REPS)を用いて学習する。ゲーティング方策は、文脈依存のオプション選択を捉えるためにガウス過程でモデル化する。
  • オプション方策の数は密度推定により自動的に決定され、事前に指定する必要がない。
  • 期待報酬最大化と報酬加重密度推定の間の理論的関係を確立し、本手法の目的関数の妥当性を裏付ける。

実験結果

リサーチクエスチョン

  • RQ1報酬加重密度推定は、階層的強化学習における多モード報酬関数のモードの数と位置を効果的に同定できるか?
  • RQ2HPSDEは、サンプル効率および最終的な性能において、最先端の階層的強化学習手法と比較してどのように性能を発揮するか?
  • RQ3HPSDEは、手動チューニングや事前学習なしに、最適なオプション方策の数を自動で決定できるか?
  • RQ4HPSDEは、連続的かつ高次元な行動空間を持つ複雑な運動計画タスクにおいて、多様で高パフォーマンスな方策をどの程度発見できるか?
  • RQ5HPSDEは、既存手法と比較して、初期化やハイパーパrameterの選択に対してどの程度頑健か?

主な発見

  • HPSDEは、7自由度のロボットアームを用いたシミュレーテッド運動計画タスクにおいて、報酬関数の異なるモードに対応する複数の明確に異なるオプション方策を学習に成功した。
  • 冗長アームタスクにおいて、HPSDE(REPSとGPゲーティング方策を併用)は、ヒューリスティックなハイパーパrameterでチューニングされたHiREPSですらも上回る性能を発揮した。
  • HPSDEは、ユーザーが指定する上限値を必要とせず、オプション方策の数(最大10個)を自動で決定した。これに対して、HiREPSは最小/最大方策数の手動チューニングを必要としていた。
  • 初期化に対して頑健であり、ハイパーパramータへの感受性も低く、唯一のオープンハイパーパラメータは最大方策数のみであった。
  • HPSDEは、ポールの背後にゴール地点に到達するための複数の有効なポージングを発見し、連続的かつ高次元の状態空間と行動空間において多様な解決策を発見できる能力を確認した。
  • HPSDEの計算コストは他の手法と同等であり、主なボトル neck はGPベースのゲーティング方策の学習であった。これは、画像などの高次元入力へのスケーラビリティを制限する要因である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。