Skip to main content
QUICK REVIEW

[論文レビュー] Sub-Goal Trees -- a Framework for Goal-Based Reinforcement Learning

Tom Jurgenson, Or Avner|arXiv (Cornell University)|Feb 27, 2020
Reinforcement Learning in Robotics参考文献 51被引用数 8
ひとこと要約

本稿では、中間的サブゴールの再帰的予測を通じて軌道を構造化する、目的ベース強化学習のための新規フレームワークであるサブゴールツリー(SGT)を紹介する。すべてのペア間最短経路問題から導出された動的計画法の定式化により、連続制御タスクにおいて優れたサンプル効率と頑健性を達成し、7自由度のロボットアームにおけるニューラルモーションプランニングにおいて、標準的なRLおよび逐次的サブゴール手法と比較して顕著な性能向上を示した。

ABSTRACT

Many AI problems, in robotics and other domains, are goal-based, essentially seeking trajectories leading to various goal states. Reinforcement learning (RL), building on Bellman's optimality equation, naturally optimizes for a single goal, yet can be made multi-goal by augmenting the state with the goal. Instead, we propose a new RL framework, derived from a dynamic programming equation for the all pairs shortest path (APSP) problem, which naturally solves multi-goal queries. We show that this approach has computational benefits for both standard and approximate dynamic programming. Interestingly, our formulation prescribes a novel protocol for computing a trajectory: instead of predicting the next state given its predecessor, as in standard RL, a goal-conditioned trajectory is constructed by first predicting an intermediate state between start and goal, partitioning the trajectory into two. Then, recursively, predicting intermediate points on each sub-segment, until a complete trajectory is obtained. We call this trajectory structure a sub-goal tree. Building on it, we additionally extend the policy gradient methodology to recursively predict sub-goals, resulting in novel goal-based algorithms. Finally, we apply our method to neural motion planning, where we demonstrate significant improvements compared to standard RL on navigating a 7-DoF robot arm between obstacles.

研究の動機と目的

  • 高次元かつ連続的な状態空間において、標準的な強化学習の限界を克服すること。
  • ゴール拡張状態空間や繰り返しの単一ゴール最適化に依存せずに、複数のゴールを自然にサポートするフレームワークを開発すること。
  • 軌道を再帰的サブゴール分解によって構造化することで、近似誤差やポリシーのずれに対する感受性を低減すること。
  • 新しい軌道表現を用いて、階層的ゴール条件付きポリシーの安定的かつスケーラブルなポリシー勾配学習を可能にすること。
  • 障害物を避けながら移動する7自由度のロボットアームのような複雑なモーションプランニングタスクにおける性能を向上させること。

提案手法

  • すべてのペア間最短経路(APSP)問題に基づく動的計画法の定式化を提案し、マルチゴール計画のための標準的なベルマン最適性方程式に代わるものとする。
  • 開始地点からゴールまでの軌道を中間的サブゴールの予測によって再帰的に部分に分割する、階層的軌道構造であるサブゴールツリー(SGT)を導入する。
  • 各ツリーのレベルでサブゴールを予測するためのポリシー勾配フレームワーク(SGT-PG)を開発し、サブゴール分布を多変量正規分布として出力するニューラルネットワークを用いる。
  • 下位の深さのポリシーからの予測を平均化することで、別個の価値関数を必要とせずに訓練を安定化させる再帰的ベースライン推定法を採用する。
  • 信頼領域とエントロピー正則化(PPOスタイル)を適用することで、訓練の安定性とサンプル効率を向上させる。
  • サブゴール分散のための距離依存的で学習可能なスケーリング要因を採用し、過度に狭い分布を防ぎ、探索性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1軌道構築の階層的・分割統治的アプローチは、マルチゴール強化学習におけるサンプル効率と頑健性を向上させることができるか?
  • RQ2逐次的またはゴール拡張RLと比較して、再帰的サブゴール予測は近似誤差やポリシーのずれに対する感受性を低減するか?
  • RQ3サブゴールツリー構造は、安定したベースライン推定を伴うポリシー勾配法で効果的に学習可能か?
  • RQ4SGT-PGの性能は、複雑なモーションプランニングシナリオにおける標準的な逐次的サブゴール手法(SeqSG)と比較してどうか?
  • RQ5SGTの再帰的構造は、連続制御タスクにおける一般化性とスケーラビリティをどの程度向上させるか?

主な発見

  • 7つのサブゴールを用いたポールのシナリオにおいて、SGT-PGは成功確率0.696 ± 0.116を達成し、同じ条件下でSeqSGの0.49 ± 0.02に比べ顕著に優れた性能を示した。
  • 単一のサブゴールでも、SGT-PGは成功確率0.646 ± 0.053を達成し、SeqSGの0.616 ± 0.013を上回った。これはSGT構造に内在する利点を示している。
  • SGT-PGは、SeqSGが過剰な勾配クリッピングや小さな信頼領域を必要としていたのと比較して、訓練の安定性が向上し、ハイパーパrameterチューニングの調整が少なく済んだ。
  • 標準的なRLで8ステップの順次的軌道構築を、同時にサブゴールを予測することで3ステップに短縮し、計算効率が向上した。
  • 別個の価値関数を必要としない再帰的ベースライン推定は、SeqSGで学習された価値関数を用いた訓練よりも安定性に優れた結果をもたらした。
  • 距離依存的分散スケーリング要因の使用により、サブゴールの多様性が向上し、ポリシー分布におけるモード崩壊が防止された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。