Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Path Planning based on MPC and DDPG

Junxiao Xue, Xiangyan Kong|arXiv (Cornell University)|Feb 26, 2021
Robotic Path Planning Algorithms参考文献 22被引用数 4
ひとこと要約

本論文は、静的および動的障害物が混在する動的環境におけるマルチエージェントパスプランニングのためのハイブリッドMPC-DDPGフレームワークを提案する。動的障害物の軌道予測にモデル予測制御(MPC)を統合し、連続的アクション空間の意思決定にディープディターミニスティックポリシー勾配(DDPG)を用いることで、DQNと比較してパスの正確性を7–30%向上させ、パス長を100単位短縮し、旋回角を400–450°削減した。Unity3Dを用いた航空母艦甲板および都市広場のシミュレーションにおいて、学習の安定性と滑らかさが向上した。

ABSTRACT

The problem of mixed static and dynamic obstacle avoidance is essential for path planning in highly dynamic environment. However, the paths formed by grid edges can be longer than the true shortest paths in the terrain since their headings are artificially constrained. Existing methods can hardly deal with dynamic obstacles. To address this problem, we propose a new algorithm combining Model Predictive Control (MPC) with Deep Deterministic Policy Gradient (DDPG). Firstly, we apply the MPC algorithm to predict the trajectory of dynamic obstacles. Secondly, the DDPG with continuous action space is designed to provide learning and autonomous decision-making capability for robots. Finally, we introduce the idea of the Artificial Potential Field to set the reward function to improve convergence speed and accuracy. We employ Unity 3D to perform simulation experiments in highly uncertain environment such as aircraft carrier decks and squares. The results show that our method has made great improvement on accuracy by 7%-30% compared with the other methods, and on the length of the path and turning angle by reducing 100 units and 400-450 degrees compared with DQN (Deep Q Network), respectively.

研究の動機と目的

  • 人工的な進行方向制約によるパスの非最適化が生じる動的環境における従来のグリッドベースパスプランニングの限界を解消すること。
  • 動的障害物を伴う高次元で連続的アクション空間において、Q学習およびDQNの収束性の低さと一般化能力の限界を克服すること。
  • 航空母艦甲板や都市広場などの複雑で不確実な環境において、パスプランニングの正確性と滑らかさを向上させること。
  • 予測制御とディープ強化学習を統合し、リアルタイムで変化する動的状況における意思決定のロバスト性を高めること。
  • 連続的アクション空間をサポートし、移動障害物にリアルタイムで適応可能な学習ベースのパスプランニングシステムを開発すること。

提案手法

  • 動的障害物の将来の軌道を予測するためにモデル予測制御(MPC)を用い、環境の不確実性を低減する。
  • 連続的アクション空間を有するディープディターミニスティックポリシー勾配(DDPG)を用い、試行錯誤による最適ナビゲーションポリシーの学習を可能にする。
  • 人工ポテンシャル場を模倣した報酬関数を設計し、目的地は引き付け、障害物は排斥するようにすることで、収束を加速させ、パス品質を向上させる。
  • 訓練および推論時に現実の運動制約を反映するために、キネマティックモデルを用いてエージェントの運動をモデル化する。
  • MPCにおいてローリングホライズン最適化フレームワークを実装し、各タイムステップで予測と制御入力を更新する。
  • Unity3Dを用いたシミュレーション環境でDDPGエージェントを訓練し、状態空間をエージェント位置、目的地位置、障害物位置とし、アクション空間を速度およびステアリング指令とする。

実験結果

リサーチクエスチョン

  • RQ1MPCに基づく障害物軌道予測は、動的環境におけるマルチエージェントパスプランニングの正確性とロバスト性を顕著に向上させるか?
  • RQ2DDPGとMPCを組み合わせることで、連続的アクション空間において標準的なDQNやA2Cと比較して、学習の安定性と収束速度がどのように向上するか?
  • RQ3人工ポテンシャル場を模倣した報酬関数は、複雑で不確実な環境においてパスの滑らかさと収束速度をどの程度向上させるか?
  • RQ4環境の複雑さが増す条件下で、本手法はDQN、A2C、DDPGと比較して、パス長、旋回角、正確性の観点でどのように差をつけるか?
  • RQ5ハイブリッドMPC-DDPGフレームワークは、最適で滑らかな軌道を維持しながら、リアルタイムでの動的障害物回避を効果的に処理できるか?

主な発見

  • 提案手法のMPC-DDPGは、シーン1においてDQNと比較してパスプランニングの正確性を8%向上させ、A2Cでは6%、DDPGでは31%向上させた。また、より複雑なシーン2においても91%の正確性を維持した。
  • シーン1においてDQNと比較して、平均パス長を100単位(438.22から328.95に)短縮し、平均旋回角を450度(586.73°から139.80°に)削減した。
  • シーン2においてDQNと比較して、パス長を150単位(465.45から315.68に)短縮し、旋回角を394度(522.62°から128.41°に)削減した。
  • 提案手法の平均報酬は約150に安定化し、A2C(100)を上回り、DDPGよりも優れた安定性を示しており、学習効率の優位性が裏付けられた。
  • パスの滑らかさとリアルタイムでの適応性が優れており、パス長および旋回角が低減したため、リソース効率とタスクの迅速性が向上した。
  • MPCによる障害物予測の統合により、アルゴリズムの一般化能力と動的環境における局所的最小値回避能力が顕著に向上し、完全に反応的または非予測的メソッドを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。