Skip to main content
QUICK REVIEW

[論文レビュー] Deep Hierarchical Planning from Pixels

Danijar Hafner, Kuang-Huei Lee|arXiv (Cornell University)|Jun 8, 2022
Reinforcement Learning in Robotics被引用数 14
ひとこと要約

Directorは、世界モデルの潜在空間で計画することで、グローバル状態や密集報酬にアクセスせずに、ピクセルから直接長時間スケールの視覚制御方策を学習する階層的強化学習エージェントである。離散的ゴールオートエンコーダと二段階ポリシー(マネージャー(高レベル)が抽象的ゴールを選択し、ワーカー(低レベル)が行動を実行)を用い、グローバル状態や密集報酬にアクセスできない状況下でも、スパarsely-rewarded 3Dナビゲーションおよび視覚制御タスクで最先端の性能を達成した。

ABSTRACT

Intelligent agents need to select long sequences of actions to solve complex tasks. While humans easily break down tasks into subgoals and reach them through millions of muscle commands, current artificial intelligence is limited to tasks with horizons of a few hundred decisions, despite large compute budgets. Research on hierarchical reinforcement learning aims to overcome this limitation but has proven to be challenging, current methods rely on manually specified goal spaces or subtasks, and no general solution exists. We introduce Director, a practical method for learning hierarchical behaviors directly from pixels by planning inside the latent space of a learned world model. The high-level policy maximizes task and exploration rewards by selecting latent goals and the low-level policy learns to achieve the goals. Despite operating in latent space, the decisions are interpretable because the world model can decode goals into images for visualization. Director outperforms exploration methods on tasks with sparse rewards, including 3D maze traversal with a quadruped robot from an egocentric camera and proprioception, without access to the global position or top-down view that was used by prior work. Director also learns successful behaviors across a wide range of environments, including visual control, Atari games, and DMLab levels.

研究の動機と目的

  • スパarsely-rewardedな視覚制御タスクにおける長時間スケール強化学習の課題に対処すること。
  • 手動によるサブタスクの指定や意味的ゴール空間を必要とする、平坦なRLおよび既存の階層的メソッドの制限を克服すること。
  • グローバル状態や密集した教師信号にアクセスせずに、生のピクセルから解釈可能で一般化可能な階層的行動学習を可能にすること。
  • 一様なハイパーパrameterセットを用いて、3Dナビゲーション、アーケードゲーム、DMLab、Control Suiteなど多様な環境で成功を示すこと。
  • 学習された潜在ゴールを視覚的画像に復号することで、人間による検査が可能な解釈可能性を提供すること。

提案手法

  • ピクセル入力からコンactな潜在空間における将来の観測を予測する世界モデル(PlaNetに基づく)を訓練する。
  • 潜在状態表現を離散的コードに圧縮するゴールオートエンコーダを導入し、高レベルの計画を可能にする。
  • K=8ステップごとにマネージャーポリシーが離散的ゴールコードを選択し、より高い時間的抽象度で動作する。
  • ゴールデコーダーを用いて離散的コードを潜在空間ゴールに変換し、ワーカーポリシーがそのゴールを追求できるようにする。
  • 現在の状態とゴールに基づいて原始的アクションを選択するワーカーポリシーを訓練し、ゴールとの類似度を最大化する。
  • マネージャーを、タスク報酬とオートエンコーダ再構成誤差に基づく探索ボーナスを用いて最適化し、時間的に拡張された探索を促進する。

実験結果

リサーチクエスチョン

  • RQ1グローバル状態や密集報酬にアクセスせずに、生のピクセルから階層的強化学習を直接学習できるか?
  • RQ2学習された世界モデルが、効果的な長時間スケール計画を可能にする解釈可能な離散的ゴール表現を提供できるか?
  • RQ3離散的ゴール選択と潜在空間計画を特徴とする二段階階層構造が、スパarsely-rewardedな視覚制御タスクで平坦なポリシーを上回るか?
  • RQ4同じハイパーパrameterとアーキテクチャが、3D迷路、アーケードゲーム、DMLabレベルなど多様な視覚環境に一般化可能か?
  • RQ5学習された潜在ゴールが、複雑なタスクにおける意味的に意味のあるサブゴールに対応しているか?

主な発見

  • Directorは、3D迷路ナビゲーション(エゴセントリックビジョンからの四足歩行ロボットを含む)を含む2つのスパarsely-rewardedベンチマークで、標準的な探索法および平坦なRLベースラインを上回った。
  • エージェントはAnt Maze Mのような長時間スケールタスクを正常に解決し、壁をターゲットにすることで報酬オブジェクトに到達するまでの間、意味的に意味のあるサブゴールに分解してナビゲートした。
  • 潜在ゴールは解釈可能である:世界モデルはそれらを画像に復号でき、エージェントが中間の視覚的ランドマークを介して計画していることが明らかになった。
  • Directorは、同じハイパーパrameterとアーキテクチャを用いて、アーケードゲーム、DMLab、Control Suiteなど多様な環境に一般化した。ワーカーポリシーにはタスク報酬信号が与えられなかった。
  • マネージャーポリシーは再構成誤差に基づくボーナスにより、時間的に拡張された探索を学習し、密集した教師信号なしで効果的な長距離ゴール発見を可能にした。
  • Ant Mazeのようなタスクでは、速度やポジション状態を暗黙的に示すゴールを選択することで、歩行とナビゲーションの協調制御を学習したが、それらは明示的に指定されていなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。