Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Reinforcement Learning using Spatio-Temporal Abstractions and Deep Neural Networks.

Ramnandan Krishnamurthy, Aravind S. Lakshminarayanan|arXiv (Cornell University)|May 17, 2016
Reinforcement Learning in Robotics参考文献 27被引用数 19
ひとこと要約

本論文は、状態空間ダイナミクスにおけるスペクトルクラスタリング(PCCA+)を用いて、事前M DPモデルが不要な状態空間ダイナミクスに基づき、抽象状態とスキルを自動で発見する階層的強化学習フレームワークを提案する。空間的・時間的抽象化と深層ニューラルネットワークを活用した表現学習により、複雑な環境(例:ビデオゲーム)においても、学習の高速化と一般化性能の向上が可能になる。

ABSTRACT

This paper introduces an automated skill acquisition framework in reinforcement learning which involves identifying a hierarchical description of the given task in terms of abstract states and extended actions between abstract states. Identifying such structures present in the task provides ways to simplify and speed up reinforcement learning learning algorithms. These structures also help to generalize such algorithms over multiple tasks without relearning policies from scratch. We use ideas from dynamical systems to find metastable regions in the state space and associate them with abstract states. The spectral clustering algorithm PCCA+ is used to identify suitable abstractions aligned to the underlying structure. Skills are defined in terms of the transitions between such abstract states. The connectivity information from PCCA+ is used to generate these skills or options. The skills are independent of the learning task and can be efficiently reused across a variety of tasks defined over a common state space. Another major advantage of the approach is that it does not need a prior model of the MDP and can work well even when the MDPs are constructed from sampled trajectories. Finally, we present our attempts to extend the automated skills acquisition framework to complex tasks such as learning to play video games where we use deep learning techniques for representation learning to aid our spatio-temporal abstraction framework.

研究の動機と目的

  • 強化学習タスクにおける階層的構造(抽象状態と拡張アクション)の自動発見を目的とする。
  • 同じ状態空間を共有する複数のタスク間で再利用可能なタスクに依存しないスキルを用いて、効率的かつ一般化可能なポリシー学習を実現すること。
  • 動的システム理論を用いて、事前M DPモデルを必要とせずに状態空間内の準安定領域を同定すること。
  • 高次元環境へのスケーラビリティを実現するため、深層ニューラルネットワークを用いた表現学習を統合すること。
  • サンプルトラジェクトリを用いて、ビデオゲーム制御などの複雑なタスクにおけるフレームワークの有効性を実証すること。

提案手法

  • 動的システム理論を用いて、状態空間内の準安定領域を同定し、これを抽象状態として扱う。
  • PCCA+スペクトルクラスタリングアルゴリズムを適用して、状態空間を下位のダイナミクスに整合した抽象状態に分割する。
  • PCCA+から得られる接続性情報を用いて、抽象状態間の遷移として拡張アクション(スキル)を定義する。
  • 同じ状態空間を共有する複数のタスクに共通して利用可能なタスクに依存しないスキルを構築する。
  • 高次元状態の低次元表現を学習するために深層ニューラルネットワークを統合し、複雑な環境における抽象化を支援する。
  • 事前定義されたM DPモデルを必要とせず、環境からのサンプルトラジェクトリに直接処理を適用する。

実験結果

リサーチクエスチョン

  • RQ1状態空間内の準安定領域を自動的に同定することで、強化学習における意味のある抽象状態を構築できるか?
  • RQ2PCCA+を用いて、複数のタスクに跨って再利用可能なタスクに依存しないスキルを生成できるか?
  • RQ3空間的・時間的抽象化は、階層的強化学習におけるサンプル効率性と一般化性能をどの程度向上できるか?
  • RQ4深層表現学習は、高次元環境における抽象化ベースの強化学習のスケーラビリティを向上できるか?
  • RQ5本フレームワークは、ビデオゲームのプレイなど複雑な現実世界のタスクにおいてどの程度有効か?

主な発見

  • 動的システム解析を用いて、状態空間内の準安定領域を成功裏に同定し、抽象状態の基盤を構築した。
  • PCCA+により、環境の下位ダイナミクスに整合した抽象状態とスキル定義の発見が可能になった。
  • 生成されたスキルは学習タスクに依存せず、同じ状態空間を共有する複数のタスクで再利用可能である。
  • 事前M DPモデルを必要とせず、環境からのサンプルトラジェクトリを効果的に処理できる。
  • 深層ニューラルネットワークとの統合により、ビデオゲーム制御などの複雑なタスクへのスケーリングが可能になった。
  • 状態空間構造から導出される階層的抽象化を活用することで、タスク間での学習効率と一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。