Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Reinforcement Learning from Logical Specifications

Kishor Jothimurugan, Suguman Bansal|arXiv (Cornell University)|Jun 25, 2021
Reinforcement Learning in Robotics参考文献 37被引用数 10
ひとこと要約

本稿では、モデルベースのハイレベル計画とモデルフリーの深層強化学習を組み合わせることで、複雑な論理的仕様から制御方策を学習する構成的強化学習フレームワークDiRLを提案する。仕様を抽象的グラフとして符号化し、Dijkstra風の計画を用いてサブタスクのためのオンザフライ方策学習を誘導することで、DiRLは線形のサンプル複雑性スケーリングを達成し、長時間スケールのタスクを含む連続制御ベンチマークで最先端のベースラインを上回る性能を発揮する。

ABSTRACT

We study the problem of learning control policies for complex tasks given by logical specifications. Recent approaches automatically generate a reward function from a given specification and use a suitable reinforcement learning algorithm to learn a policy that maximizes the expected reward. These approaches, however, scale poorly to complex tasks that require high-level planning. In this work, we develop a compositional learning approach, called DiRL, that interleaves high-level planning and reinforcement learning. First, DiRL encodes the specification as an abstract graph; intuitively, vertices and edges of the graph correspond to regions of the state space and simpler sub-tasks, respectively. Our approach then incorporates reinforcement learning to learn neural network policies for each edge (sub-task) within a Dijkstra-style planning algorithm to compute a high-level plan in the graph. An evaluation of the proposed approach on a set of challenging control benchmarks with continuous state and action spaces demonstrates that it outperforms state-of-the-art baselines.

研究の動機と目的

  • 高レベルの論理言語による記述で与えられる複雑で長時間スケールのタスクの制御方策を学習する課題に対処すること。
  • 複雑なタスク構成を扱う際の報酬関数ベースの強化学習手法のスケーラビリティの低さを克服すること。
  • 仕様の構造的分解を活用して、ハイレベル計画とローレベルの方策学習を分離する手法を開発すること。
  • 複雑な仕様を伴う連続制御環境におけるサンプル効率と成功確率を向上させること。
  • 複雑な論理的ゴールを満たす確率が高いまま、スケーラブルで構成的な方策学習を可能にすること。

提案手法

  • 論理的仕様を、頂点が状態領域を表し、辺がサブタスクを表す抽象的グラフに変換する。
  • 仕様の満たされる確率を最大化する高レベル計画を計算するために、Dijkstra風の前向き探索を用いる。
  • 計画経路に沿う各サブタスクについて、必要に応じてオンザフライでモデルフリー強化学習によりニューラルネットワーク方策を学習する。
  • 計画と方策学習のプロセスを通じて、仕様の満たされる確率の下限を維持する。
  • 学習済みの経路方策を用いて、サブゴール領域からのオンザフライサンプリングを可能にし、サブゴール領域内の任意の状態から軌道生成を可能にする。
  • アプローチは、仕様グラフのサイズに比例して線形にスケーリングされるように設計されており、エンドツーエンド強化学習と比較してサンプル複雑性を低減する。

実験結果

リサーチクエスチョン

  • RQ1ハイレベル計画とオンデマンドのローレベル方策学習をインタリーブする構成的強化学習フレームワークは、複雑な論理的仕様においてエンドツーエンド強化学習よりも優れたサンプル効率を達成できるか?
  • RQ2論理的仕様の構造的分解を活用することで、仕様サイズに比例してサンプル複雑性が線形にスケーリングされるか?
  • RQ3このようなフレームワークは、Spectrl、Tltl、Qrm、Hrm、R-aviといった最先端の手法を、長時間スケールの連続制御タスクで上回ることができるか?
  • RQ4高次元状態空間と複雑な制約を伴う環境、例えばFetchロボットアーム環境において、この手法はどの程度効果的か?
  • RQ5サブゴール領域が部分的に入りにくくなっている場合でも、この手法はどの程度ロバストであるか?

主な発見

  • DiRLは、9-Rooms環境およびFetch環境の両方で、Spectrl、Tltl、Qrm、Hrm、R-aviを含む最先端のベースラインを著しく上回り、学習成功確率が優れている。
  • DiRLのサンプル複雑性は、仕様グラフのエッジ数にほぼ線形に比例しており、タスクの複雑性が増加するに従い効率的なスケーリングが実証されている。
  • 9-Rooms環境では、必要なサブタスク数が増えるにつれて、DiRLはすべてのベースラインよりも高い成功確率をより速く達成している。
  • 高次元状態空間を伴う挑戦的なFetch環境では、条件付きおよび順序付きサブゴールを含む複雑なタスクに対しても、DiRLは効果的な方策を学習している。
  • ドアが閉ざされたりアクセスが制限されたりする環境でも、DiRLは複数の仕様に対して高い性能を維持しており、ロバストである。
  • 実験的結果から、DiRLの成功確率はベースラインよりも速く収束し、より高い値に達しており、学習曲線は安定的かつスケーラブルな学習を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。