Skip to main content
QUICK REVIEW

[論文レビュー] Decentralized Task and Path Planning for Multi-Robot Systems

Yuxiao Chen, Ugo Rosolia|arXiv (Cornell University)|Nov 19, 2020
Reinforcement Learning in Robotics参考文献 28被引用数 4
ひとこと要約

本稿では、タスク割り当てと衝突のない経路計画を統合的に最適化する完全に分散型のタスクおよび経路計画(DTPP)フレームワークを提案する。マルコフ決定過程(MDP)または部分的に観測可能なMDP(MOMDP)の要因グラフ表現を用い、max-sumアルゴリズムにより期待純報酬(報酬からコストを差し引いたもの)を最大化する分散型タスク割り当てを実現する。一方、局所的な前向き動的計画法により、リアルタイムでエージェント間の衝突を解消する。ROSシミュレーションおよびSegwayとTurtlebotの実機実験により有効性が実証された。

ABSTRACT

We consider a multi-robot system with a team of collaborative robots and multiple tasks that emerges over time. We propose a fully decentralized task and path planning (DTPP) framework consisting of a task allocation module and a localized path planning module. Each task is modeled as a Markov Decision Process (MDP) or a Mixed Observed Markov Decision Process (MOMDP) depending on whether full states or partial states are observable. The task allocation module then aims at maximizing the expected pure reward (reward minus cost) of the robotic team. We fuse the Markov model into a factor graph formulation so that the task allocation can be decentrally solved using the max-sum algorithm. Each robot agent follows the optimal policy synthesized for the Markov model and we propose a localized forward dynamic programming scheme that resolves conflicts between agents and avoids collisions. The proposed framework is demonstrated with high fidelity ROS simulations and experiments with multiple ground robots.

研究の動機と目的

  • タスクが時間とともに出現し、連携を要するマルチロボットシステムにおける分散型タスクおよび経路計画の課題に対処すること。
  • 分散的に、ロボットチームの期待純報酬(報酬からコストを差し引いたもの)を最大化すること。
  • 中央集権的な調整やグローバルな状態情報がなくとも、経路実行中のエージェント間の衝突を解消すること。
  • 局所的で分散型の計算を用いて、リアルタイムかつスケーラブルなマルチロボットシステムの連携を実現すること。

提案手法

  • 各ロボットは、確率的ダイナミクスと部分的観測可能性を表現するMDPまたはMOMDPとしてモデル化される。
  • 期待純報酬の合計は、タスクをノード、エージェント間の依存関係をエッジとして表す要因グラフとして定式化される。
  • max-sumアルゴリズムが要因グラフに適用され、完全に分散型の最適タスク割り当てが達成される。
  • 局所的な前向き動的計画法により、エージェント間の潜在的衝突がリアルタイムで再計画された局所的軌道によって解消される。
  • ハイレベルな命令が低レベルコントローラー(例:MPCまたはPID)に送られ、ウェイポイントと制約に基づいてリアルタイムの制御入力を生成する。
  • システムは、タスク割り当て、衝突解消、低レベル制御を階層的で分散型のアーキテクチャで統合する。

実験結果

リサーチクエスチョン

  • RQ1完全に分散型のマルチロボットシステムにおいて、タスク割り当てと経路計画をどのように統合的に最適化できるか?
  • RQ2部分的観測性を有する分散型MDP/MOMDPフレームワークにおいて、max-sumアルゴリズムが最適タスク割り当てを効果的に解けるか?
  • RQ3グローバルな調整や将来の行動に関する事前知識なしに、エージェント間の衝突をどのように局所的に解消できるか?
  • RQ4DTPPフレームワークは、動的で現実世界のシナリオにおいて、期待純報酬および衝突回避の観点でどの程度の性能を示すか?

主な発見

  • DTPPフレームワークは、max-sumアルゴリズムを用いて完全に分散型のタスク割り当てを実現し、複数のロボットにおける期待純報酬を最大化した。
  • 局所的な前向き動的計画法は、軌道が重複する場合でも、リアルタイムでエージェント間の衝突を効果的に回避した。
  • ROSシミュレーションにおいて3台のSegwayロボットを用いた実験では、既存のタスクが期限切れになると動的に再割り当てが行われ、安全なナビゲーションを保証した。
  • 5×5グリッド上での2台のTurtlebotを用いた実験では、max-sumアルゴリズムが有益である場合にロボットを異なるタスクに正しく割り当て、コストを削減するために1台のロボットを停止させるのを許容した。
  • 期待純報酬曲線(図8)は、新規タスクの出現に応じた動的適応を示し、高報酬タスクが出現した際には値が上昇した。
  • MPCおよびPIDコントローラーを用いることで、システムはリアルタイム性能を維持し、物理的ロボット上でも安定した実行を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。