Skip to main content
QUICK REVIEW

[論文レビュー] Learning World Graphs to Accelerate Hierarchical Reinforcement Learning

Wenling Shang, Alex Trott|arXiv (Cornell University)|Jul 1, 2019
Reinforcement Learning in Robotics被引用数 10
ひとこと要約

本論文は、階層強化学習(HRL)のサンプル効率を向上させるために、自己教師あり探索から世界グラフ(重要な状態と通過可能なエッジから構成される)を学習する二段階フレームワークを提案する。好奇心駆動のゴール条件付き方策と微分可能なバイナリ潜在変数モデルを用いることで、キーポints(重要な状態)と接続関係が同定され、高レベルのマネージャーが「広い範囲から狭い範囲へ」という指示を出すことで、低レベルのワーカーがグラフ探索によって下流のタスクを効率的に解けるようになる。これにより、ベースラインと比較して、サンプル効率と性能が顕著に向上する。

ABSTRACT

In many real-world scenarios, an autonomous agent often encounters various tasks within a single complex environment. We propose to build a graph abstraction over the environment structure to accelerate the learning of these tasks. Here, nodes are important points of interest (pivotal states) and edges represent feasible traversals between them. Our approach has two stages. First, we jointly train a latent pivotal state model and a curiosity-driven goal-conditioned policy in a task-agnostic manner. Second, provided with the information from the world graph, a high-level Manager quickly finds solution to new tasks and expresses subgoals in reference to pivotal states to a low-level Worker. The Worker can then also leverage the graph to easily traverse to the pivotal states of interest, even across long distance, and explore non-locally. We perform a thorough ablation study to evaluate our approach on a suite of challenging maze tasks, demonstrating significant advantages from the proposed framework over baselines that lack world graph knowledge in terms of performance and efficiency.

研究の動機と目的

  • 複雑でマルチタスクな環境において、階層的強化学習におけるサンプル非効率性と一般化性能の低さという課題に取り組む。
  • 人為的なランドマークを一切用いずに、環境の構造的本質を捉える、コンパクトで意味のある世界抽象化(有向かつ重み付きグラフ)を発見する。
  • 世界グラフの知識を階層的方策に統合することで、新しいタスクの学習を加速する、新しいゴール指示およびナビゲーションメカニズムを提供する。
  • 世界グラフ発見段階で得られた好奇心駆動のゴール条件付き方策を用いてHRL方策を初期化することで、迅速な転移学習を可能にする。

提案手法

  • バイナリ潜在変数を備えた再帰的変分オートエンコーダーを訓練し、アクション軌道の再構成を可能にする重要な状態(キーポイント状態)を同定する。
  • ランダムウォークと好奇心駆動のゴール条件付き方策を交互に実行する自己教師あり探索戦略を採用し、世界グラフ学習に適した多様な軌道を収集する。
  • 近接するキーポイント状態間の実行可能で意味のある遷移に基づき、世界グラフのエッジを構築する。この情報は、軌道データとゴール条件付き方策の両方から得られる。
  • 新規に提案された「広い範囲から狭い範囲へ」(WN)という指示メカニズムにより、高レベルのマネージャーはまずキーポイント状態を選択し、その後その近隣の局所領域内でゴールを指定できる。
  • 低レベルのワーカーは、Dijkstraに類似したグラフ探索アルゴリズムを用いて、キーポイント状態間を効率的に移動し、長距離かつ非局所的な探索を可能にする。
  • 世界グラフ発見段階で学習したゴール条件付き方策(πg)を、HRL方策の初期化に再利用することで、新しいタスクへの高速な適応が実現する。

実験結果

リサーチクエスチョン

  • RQ1自己教師ありで自己学習する手法が、複雑な環境の構造的骨格を表すキーポイント状態を効果的に発見できるか?
  • RQ2学習済みの世界グラフを統合することで、階層的強化学習におけるサンプル効率と最終的な性能がどの程度向上するか?
  • RQ3「広い範囲から狭い範囲へ」という指示メカニズムは、標準的なゴール条件付きHRLに比べて、収束速度と解の質の両面でどの程度優れているか?
  • RQ4世界グラフ抽象化は、再トレーニングなしに多様な下流タスクに一般化可能か?
  • RQ5世界グラフ発見段階で学習した好奇心駆動の方策(πg)をHRL方策の初期化に用いることで、新しいタスクでの収束がどの程度速くなるか?

主な発見

  • 学習済みの世界グラフはサンプル効率を顕著に向上させる。世界グラフを用いたモデルは、それを使わないベースラインと比較して、より速く収束し、最終的な性能も高い。
  • ランダム状態(Vrand)ではなくキーポイント状態(Vp)を用いることで、シードごとの性能ばらつきが低減され、特に非決定的環境では一貫して優れた結果が得られる。
  • グラフ探索メカニズムにより学習が加速され、探索有効時と比較して、トレーニング曲線がより速く収束する。
  • 「広い範囲から狭い範囲へ」指示メカニズムは、標準的なゴール条件付き学習を上回る。これは、グラフ構造を活用してマネージャーがより効果的な中間目標を選択できるからである。
  • 世界グラフ発見段階で得たゴール条件付き方策(πg)による初期化は、明確な性能優位性を示し、有効なスキル転送が実現していることを裏付ける。
  • アブレーションスタディの結果、キーポイント状態の同定、グラフ探索、WN指示、πg初期化の各要素が、全体の性能向上に顕著に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。