Skip to main content
QUICK REVIEW

[論文レビュー] Provable Hierarchical Imitation Learning via EM

Zhe Zhang, Ioannis Ch. Paschalidis|arXiv (Cornell University)|Oct 7, 2020
Robot Manipulation and Learning参考文献 41被引用数 4
ひとこと要約

本稿は、階層的模倣学習(HIL)におけるEMに基づく収束性を保証するアルゴリズムを提案する。HILを潜在変数モデルにおけるパラメータ推定問題として定式化し、正則性条件下で、アルゴリズムが真のパラメータのノルム球の周囲に高確率で収束することを示す。これは、オプションや教師信号が観測されない状態で、未分割の状態-行動データのみを用いたHILに対して、初めての理論的保証を提供する。

ABSTRACT

Due to recent empirical successes, the options framework for hierarchical reinforcement learning is gaining increasing popularity. Rather than learning from rewards which suffers from the curse of dimensionality, we consider learning an options-type hierarchical policy from expert demonstrations. Such a problem is referred to as hierarchical imitation learning. Converting this problem to parameter inference in a latent variable model, we theoretically characterize the EM approach proposed by Daniel et al. (2016). The population level algorithm is analyzed as an intermediate step, which is nontrivial due to the samples being correlated. If the expert policy can be parameterized by a variant of the options framework, then under regularity conditions, we prove that the proposed algorithm converges with high probability to a norm ball around the true parameter. To our knowledge, this is the first performance guarantee for an hierarchical imitation learning algorithm that only observes primitive state-action pairs.

研究の動機と目的

  • 階層的模倣学習(HIL)における理論的基盤の欠如に取り組む。現存の手法は主に経験的であり、一般化保証が欠如している。
  • HILを潜在変数モデルの推論問題として形式化し、学習アルゴリズムの厳密な分析を可能にする。
  • HILにおけるEMアルゴリズムの収束保証を確立する。特に、時系列的に相関するサンプルの課題に直面する状況を想定する。
  • 有限標本におけるEMの性能と母集団レベルの収束のギャップを埋め、初期化に強く依存しない堅牢性を確保する。
  • ロボット工学およびディープ強化学習におけるEMベースのHIL手法の実用的成功に対する理論的根拠を提供する。

提案手法

  • オプションが観測されず、未分割の状態-行動シーケンスから推定されなければならない、潜在変数モデルにおけるパラメータ推定問題としてHILを定式化する。
  • 期待最大化(EM)アルゴリズムを採用し、反復的なEステップとMステップにより、高レベル方策とオプションパラメータを同時に推定する。
  • 収束が真のパラメータに至ることを保証するため、無限標本極限におけるQ関数を用いて定義される、母集団EMアルゴリズムを導入する理論的補助ツールとしての役割を果たす。
  • 有限標本におけるEMアルゴリズムを母集団EMの摂動とみなして分析し、真のパラメータの周囲のノルム球への高確率収束を証明する。
  • 時系列相関があるデータに対しても、有限標本Q関数が母集団Q関数に確率的収束することを確立する。
  • 一様な忘却論法と集中不等式を用いて、標本のランダムネスの影響を制御し、初期化に強く依存しないことを保証する。

実験結果

リサーチクエスチョン

  • RQ1階層的模倣学習におけるEMアルゴリズムは、収束保証を理論的に裏付けることができるか?
  • RQ2原始的な状態-行動ペアしか観測されない状況でも、アルゴリズムは真のパラメータの近傍に収束するか?
  • RQ3アルゴリズムの性能は初期化、標本サイズ、モデルの複雑さにどのように依存するか?
  • RQ4母集団EMフレームワークは、HILのような時系列的潜在変数モデルにおける従属サンプルに適応可能か?
  • RQ5標本のばらつきと有限データの影響は、HILにおけるEMアルゴリズムの収束にどのような影響を及けるか?

主な発見

  • 正則性条件下で、HILのEMアルゴリズムは真のパラメータの周囲のノルム球に高確率で収束し、未分割のデータを用いたHILに対する初めての理論的性能保証を提供する。
  • 母集団EMアルゴリズムは真のパラメータに収束し、有限標本におけるEMアルゴリズムも、相関する時系列データが存在する状況でも、真のパラメータの近傍に高確率で収束する。
  • 初期化に強く依存せず、初期化の影響が小さい。実験的検証では、10イテレーション以内に推定誤差が50%以上削減されることが高確率で達成された。
  • 標本サイズTが大きい場合には、忘却係数μの最終的性能への影響は無視できる。N=1000イテレーションにおけるμの値の違いによる性能差は最大で0.7%にとどまる。
  • ランダム初期化の実験により、局所的収束が確認された。初期誤差が中程度(w=0.2)の場合に成功し、初期誤差が大きい(w=0.3)場合には失敗し、すでに最適解に近い状態(w=0.1)では改善がほとんど見られなかった。
  • 複数のT値(5000, 8000, 10000)において、推定誤差の初期段階における指数的減衰が観測された。これは、アルゴリズムの初期段階に一般的な収束パターンが存在することを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。