Skip to main content
QUICK REVIEW

[論文レビュー] Trajectory Optimization for Unknown Constrained Systems using Reinforcement Learning

Kei Ota, Devesh K. Jha|arXiv (Cornell University)|Mar 13, 2019
Reinforcement Learning in Robotics参考文献 23被引用数 4
ひとこと要約

本論文では、未知のロボットシステム向けに動的に滑らかで制約付きの軌道を高速に生成するため、サンプリングベースのプランナ(RRT)から得られる参照軌道を活用した強化学習(RL)手法を提案する。カリキュラム学習とゴール条件付き方策を用いることで、学習の収束が速まり、ゴールの摂動に対しても一般化が可能となり、PIDコントローラーと比較してシミュレーションおよび6-DoFマニピュレータでの実世界実験の両方で、加速度プロファイルが低く、追従性能が優れていることを示した。

ABSTRACT

In this paper, we propose a reinforcement learning-based algorithm for trajectory optimization for constrained dynamical systems. This problem is motivated by the fact that for most robotic systems, the dynamics may not always be known. Generating smooth, dynamically feasible trajectories could be difficult for such systems. Using sampling-based algorithms for motion planning may result in trajectories that are prone to undesirable control jumps. However, they can usually provide a good reference trajectory which a model-free reinforcement learning algorithm can then exploit by limiting the search domain and quickly finding a dynamically smooth trajectory. We use this idea to train a reinforcement learning agent to learn a dynamically smooth trajectory in a curriculum learning setting. Furthermore, for generalization, we parameterize the policies with goal locations, so that the agent can be trained for multiple goals simultaneously. We show result in both simulated environments as well as real experiments, for a $6$-DoF manipulator arm operated in position-controlled mode to validate the proposed idea. We compare the proposed ideas against a PID controller which is used to track a designed trajectory in configuration space. Our experiments show that our RL agent trained with a reference path outperformed a model-free PID controller of the type commonly used on many robotic platforms for trajectory tracking.

研究の動機と目的

  • 未知の動的特性と状態/制御制約を有するロボットシステムに対して、動的に実行可能で滑らかな軌道を生成する課題に対処すること。
  • 市販のサンプリングベースのプランナ(RRT)から得られる参照軌道を用いることで、モデルフリーRLにおけるサンプルの複雑さを低減し、学習を加速すること。
  • ゴール条件付き方策パラメータ化により、新しいゴール位置への一般化を可能とすること。
  • 6-DoFマニピュレータ上で高精度なシミュレーションおよび実世界実験により、本手法の有効性を検証すること。
  • 軌道の滑らかさと収束速度の観点から、従来のPIDベースの軌道追従制御を上回ること。

提案手法

  • RLエージェントは、状態-行動ペアのQ値を推定するコントロールネットワークを備えたゴール条件付きディープ決定的方策勾配(DDPG)アルゴリズムで訓練される。
  • カリキュラム学習戦略が採用され、訓練はより簡単なタスク(例:短いパス、少ない障害物)から開始され、段階的に難易度を上げることで、学習の安定性と収束の改善が図られる。
  • 自己模倣が用いられ、過去の成功エピソードからの高報酬経験を再利用することで、動的衝突ペナルティによる報酬ノイズを低減し、サンプル効率を向上させる。
  • RRTから得られる参照軌道がデモンストレーションとして用いられ、探索空間を制限し、方策学習の加速が図られる。
  • エージェントのアクトロとクリティックネットワークはゴール状態に条件付けられており、定義された領域内での新しいゴール位置へのゼロショット一般化が可能となる。
  • 本手法はシミュレーションで訓練され、ドメインランダマイゼーションやファインチューニングを経ずに、実際の6-DoFマニピュレータに直接転送された。

実験結果

リサーチクエスチョン

  • RQ1RRTプランナから得られる参照軌道によってガイドされたモデルフリーRLエージェントは、未知の制約付きシステムに対して、動的に滑らかな軌道を効率的に学習できるか?
  • RQ2カリキュラム学習と自己模倣は、高次元かつ制約のあるロボット制御タスクにおける学習の安定性と収束速度を向上させるか?
  • RQ3再トレーニングなしで、局所領域内の新しいゴール位置に一般化できるか?
  • RQ4本手法は、標準のPIDコントローラーと比較して、軌道の滑らかさと収束時間の観点で優れているか?
  • RQ5シミュレーションから実際の6-DoFマニピュレータアームに、RL方策を成功裏に転送できるか?

主な発見

  • カリキュラム学習や自己模倣を用いない学習と比較して、本手法は著しく収束が速く、学習がより安定した。
  • 全タスクにおいて、ベースラインのPIDコントローラーと比較して、関節の加速度が顕著に低減され、滑らかな制御入力が得られた。
  • 本手法では、全タスクで0.22~0.50秒の間でゴールに到達したのに対し、PIDベースラインは0.56~1.28秒であった。収束速度の向上が明確に示された。
  • ゴール摂動に対する一般化性能は良好で、シミュレーションでは100×100 mmのゴール領域で98%の成功率、200×200 mm領域では90%の成功率を達成した。
  • 実世界実験により、シミュレーションから実ロボットへの方策転送が成功したことが確認され、低加速度と高い追従精度を維持した。
  • RRTガイド、カリキュラム学習、ゴール条件付き方策の組み合わせにより、状態および制御制約を伴う複雑な環境でも、実行可能な軌道をエージェントが学習可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。