Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Reinforcement Learning for Sequencing Behaviors

Hadi Salman, Jaskaran Grover|arXiv (Cornell University)|Mar 5, 2018
Robot Manipulation and Learning参考文献 6被引用数 19
ひとこと要約

本論文は、視覚入力を用いてロボットナビゲーションスキルを共同で学習し、それらを順序付けする階層的強化学習フレームワークを提案する。深層ニューラルネットワークを活用することで、環境を越えて一般化できる。本手法は、原始観測からポリシーと状態表現をエンド・ツー・エンドで学習することで、手作業で設計されたヒューリスティクスが不要なロバストなナビゲーションを達成し、従来の計画手法を上回る性能を発揮する。

ABSTRACT

Recent literature in the robot learning community has focused on learning robot skills that abstract out lower-level details of robot control, such as Dynamic Movement Primitives (DMPs), the options framework in hierarchical RL, and subtask policies. To fully leverage the efficacy of these macro actions, it is necessary to then sequence these primitives to achieve a given task. Our objective is to jointly learn a set of robot skills and a sequence of these learnt skills to accomplish a given task. We consider the task of navigating a robot across various environments using visual input, maximizing the distance traveled through the environment while avoiding static obstacles. Traditional planning methods to solve this problem rely on hand-crafted state representations and heuristics for planning, and often fail to generalize. In contrast, deep neural networks have proved to be powerful function approximators, successfully modeling complex control policies. In addition, the ability of such networks to learn good representations of high-dimensional sensory inputs makes them a valuable tool when dealing with visual inputs. In this project, we explore the capability of deep neural networks to learn and sequence robot skills for navigation, directly using visual input.

研究の動機と目的

  • 静的障害物を有する多様な環境にまたがるロボットナビゲーションの一般化に取り組む。
  • 手作業で設計された状態表現やヒューリスティクスに依存する従来の計画手法の限界を克服する。
  • 視覚入力を用いてロボットスキルとその順序付けをエンド・ツー・エンドで学習することを可能にする。
  • 高次元のセンサデータから効果的な状態表現と制御ポリシーを学習するため、深層ニューラルネットワークを活用する。
  • スキルポリシーとその順序付けポリシーの共同学習により、ロバストなナビゲーション性能を達成する

提案手法

  • ナビゲーションをマクロアクション(スキル)とそれらを順序付ける上位レベルのポリシーに分解する階層的強化学習を採用する。
  • 原始的な視覚入力を直接ポリシー出力にマップする深層ニューラルネットワークを用い、手作業で設計された特徴量の必要性を排除する。
  • 累積移動距離を最大化し、障害物を避けることを目的に強化学習でシステムを訓練する。
  • 低レベルのスキルポリシーと高レベルの順序付けポリシーを、統合最適化フレームワークで同時に学習する。
  • 視覚入力と制御ポリシーの間の複雑で非線形な関係をモデル化するために、深層ネットワークによる関数近似を活用する。
  • 視覚観測を入力として用い、ポリシー勾配法を適用して階層的ポリシー構造を最適化する

実験結果

リサーチクエスチョン

  • RQ1階層的強化学習フレームワークは、手作業で設計された特徴量が不要な状態で、視覚入力から効果的なナビゲーションスキルを学習できるか?
  • RQ2共同で訓練されたスキルと順序付けポリシーは、静的障害物を有する多様な環境において、どの程度一般化できるか?
  • RQ3原始的な視覚データからポリシーと表現をエンド・ツー・エンドで学習することは、手作業で設計されたヒューリスティクスを用いた従来の計画手法を上回るか?
  • RQ4深層ニューラルネットワークは、長時間スパンのナビゲーションタスクを支援する意味のある状態表現をどの程度学習できるか?
  • RQ5フラットな強化学習アプローチと比較して、階層的構造はサンプル効率とタスクパフォーマンスを向上させるか?

主な発見

  • 提案された階層的強化学習フレームワークは、視覚入力から直接ナビゲーションポリシーを学習し、多様な環境でロバストなパフォーマンスを達成した。
  • 手作業で設計された状態表現やヒューリスティクスに依存する従来の計画手法と比較して、本手法はより優れた一般化性能を示した。
  • 深層ニューラルネットワークは、原始的な視覚観測からスキルポリシーとその順序付けポリシーを効果的に学習した。
  • スキルと順序付けポリシーの共同学習により、障害物を避けながら長距離ナビゲーションが可能になった。
  • 深層ネットワークの表現学習能力のおかげで、未確認の環境への適応性が向上した。
  • ベースライン手法と比較して、累積移動距離が向上したため、効果的なスキル順序付けが実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。