Skip to main content
QUICK REVIEW

[論文レビュー] Sub-Goal Trees -- a Framework for Goal-Directed Trajectory Prediction and Optimization

Tom Jurgenson, Edward Groshev|arXiv (Cornell University)|Jun 12, 2019
Reinforcement Learning in Robotics参考文献 34被引用数 6
ひとこと要約

本論文は、ゴール指向の軌道を再帰的な部分ゴールセグメントに分解する階層的ツリー型軌道表現であるSub-Goal Treesを導入する。同時に部分ゴールを予測し、すべてのペア間最短経路問題のための新しい動的計画法を用いることで、教師あり模倣学習および強化学習の両方において、従来の逐次的手法よりも高速かつ高精度な軌道予測と最適化を実現し、精度と推論速度の両面で優れている。

ABSTRACT

Many AI problems, in robotics and other domains, are goal-directed, essentially seeking a trajectory leading to some goal state. In such problems, the way we choose to represent a trajectory underlies algorithms for trajectory prediction and optimization. Interestingly, most all prior work in imitation and reinforcement learning builds on a sequential trajectory representation -- calculating the next state in the trajectory given its predecessors. We propose a different perspective: a goal-conditioned trajectory can be represented by first selecting an intermediate state between start and goal, partitioning the trajectory into two. Then, recursively, predicting intermediate points on each sub-segment, until a complete trajectory is obtained. We call this representation a sub-goal tree, and building on it, we develop new methods for trajectory prediction, learning, and optimization. We show that in a supervised learning setting, sub-goal trees better account for trajectory variability, and can predict trajectories exponentially faster at test time by leveraging a concurrent computation. Then, for optimization, we derive a new dynamic programming equation for sub-goal trees, and use it to develop new planning and reinforcement learning algorithms. These algorithms, which are not based on the standard Bellman equation, naturally account for hierarchical sub-goal structure in a task. Empirical results on motion planning domains show that the sub-goal tree framework significantly improves both accuracy and prediction time.

研究の動機と目的

  • ゴール指向のタスクにおける逐次的軌道表現の限界、例えば誤差の蓄積や遅い推論速度を解消すること。
  • 階層的部品ゴール分解を用いてマルチモーダルな変動をモデル化することで、軌道予測の精度を向上させること。
  • 関数近似と階層的計画をサポートする、すべてのペア間最短経路問題のための新しい動的計画法を考案すること。
  • 軌道セグメント間で並列して部分ゴールを計算することにより、テスト時の推論速度を向上させること。
  • 部分ゴール構造を活用することで、長時間スパンのゴール条件付き制御タスクにおける強化学習の性能を向上させること。

提案手法

  • 開始地点からゴールまでのパスを再帰的に中間部分ゴールに分割することで、軌道を部分ゴールの木として表現する。
  • 複数の部分ゴールを並列に予測する同時予測メカニズムを用い、テスト時の逐次的ステップ数を削減する。
  • 部分ゴールツリーに基づいて、すべてのペア間最短経路問題のための新しい動的計画方程式を導出する。これにより階層的最適化が可能になる。
  • 関数近似(例:KNN)を用いて連続状態に対応するため、部分ゴールツリー枠組みを教師あり模倣学習および強化学習の両方へ適用する。
  • 学習済みの部分ゴールツリーからポリシーを抽出するために逆モデルまたはQ値コントローラーを用いる。
  • 近似的な動的計画法の実行中に、部分ゴール候補を探索するために離散化された状態グリッドを用いる。

実験結果

リサーチクエスチョン

  • RQ1階層的でツリー型の軌道表現は、ゴール指向の軌道学習における予測精度と速度を向上させることができるか?
  • RQ2部分ゴールツリーに基づく動的計画法は、標準的なベルマンベースの手法と比較して、すべてのペア間最短経路問題を解く際に優れているか?
  • RQ3部分ゴールツリーは、関数近似を用いた強化学習における長時間スパンの計画を向上させることができるか?
  • RQ4並列で部分ゴールを予測することで、テスト時の軌道生成において指数的スピードアップが達成できるか?
  • RQ5部分ゴールツリーは、逐次的モデルと比較して、マルチモーダルな軌道変動をよりよく捉えることができるか?

主な発見

  • 模倣学習では、マルチモーダルな変動をモデル化することで、部分ゴールツリーがより高い軌道予測精度を達成した。テスト時の推論ステップは8ステップの逐次モデルと比較してわずか3ステップにまで削減された。
  • 2次元粒子運動計画タスクにおいて、逆モデルコントローラーを用いた部分ゴールツリーは、平均ゴールまでの距離が0.13にまで低下した。これは、適合Qベースラインの0.58よりも顕著に優れている。
  • Q値コントローラーを用いた部分ゴールツリーは、障害物回避の観点で優れた性能を示し、衝突率が0.06にまで低下した。逆モデルの0.25よりも低く、コストを考慮したポリシーが有効に機能した。
  • 近似的なSTDPアルゴリズムは、ほぼすべてのテストケースで意味のある部分ゴールを効果的に計算し、有効な長時間スパンの計画を可能にした。
  • 近似的なSTDPで学習された価値関数は、部分ゴールの段階数が増えるにつれて、ゴールに向かって到達可能領域が徐々に拡大する傾向を示した。
  • 本フレームワークは、関数近似をサポートする最初のAPSPアルゴリズムであり、連続状態制御問題への応用を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。