Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Experience in Lifelong Multi-Agent Pathfinding

Nitzan Madar, Kiril Solovey|arXiv (Cornell University)|Feb 9, 2022
Robotic Path Planning Algorithms被引用数 4
ひとこと要約

本稿では、Lifelong Multi-Agent Pathfinding (L-MAPF) のための新規手法 exRHCR を提案する。この手法は、過去の解決経験を活用することで計画を高速化する。Priority-Based Search (PBS) を、学習済みエージェント優先順位集合を用いた経験に配慮したウォームスターティングで拡張することで、exRHCR は RHCR と比較して平均実行時間を最大39%短縮し、動的タスクスティームにおけるシステムスループットを顕著に向上させる。

ABSTRACT

In Lifelong Multi-Agent Path Finding (L-MAPF) a team of agents performs a stream of tasks consisting of multiple locations to be visited by the agents on a shared graph while avoiding collisions with one another. L-MAPF is typically tackled by partitioning it into multiple consecutive, and hence similar, "one-shot" MAPF queries, as in the Rolling-Horizon Collision Resolution (RHCR) algorithm. Therefore, a solution to one query informs the next query, which leads to similarity with respect to the agents' start and goal positions, and how collisions need to be resolved from one query to the next. Thus, experience from solving one MAPF query can potentially be used to speedup solving the next one. Despite this intuition, current L-MAPF planners solve consecutive MAPF queries from scratch. In this paper, we introduce a new RHCR-inspired approach called exRHCR, which exploits experience in its constituent MAPF queries. In particular, exRHCR employs an extension of Priority-Based Search (PBS), a state-of-the-art MAPF solver. The extension, which we call exPBS, allows to warm-start the search with the priorities between agents used by PBS in the previous MAPF instances. We demonstrate empirically that exRHCR solves L-MAPF instances up to 39% faster than RHCR, and has the potential to increase system throughput for given task streams by increasing the number of agents a planner can cope with for a given time budget.

研究の動機と目的

  • 構造的に類似する複数の L-MAPF クエリを、再び初期状態から解く非効率性を是正すること。
  • 連続するクエリ間でエージェントの開始/目的地位置および衝突解決パターンの時間的類似性を活用すること。
  • 過去の MAPF 解の経験を統合することで RHCR アルゴリズムの効率を向上させること。
  • 繰り返し発生する類似した MAPF インスタンスにおいて収束を加速する PBS 用ウォームスターティング機構を開発すること。

提案手法

  • 過去に学習したエージェント優先順位集合を用いてプライオリティツリーを初期化する exPBS に PBS を拡張する。
  • 探索幅を制限する幅制限付き深さ優先探索 (WL-DFS) を用いてプライオリティツリーを探索し、過剰な探索を回避する。
  • 幅制限に達した場合またはルート優先順位集合が実行不可能な場合、標準 PBS にフォールバックする。
  • 連続する MAPF クエリを δ+1 個のバッチにグループ化し、最初のクエリは PBS で、残りの δ 個は共有された経験を用いて exPBS で解く。
  • WL-DFS の探索深さを制御するパラメータ ℓ を導入し、性能とトレードオフを調整可能にする。
  • ラジアルプロットとアブレーションスタディを用いて、ℓ が実行時間、PT 幅、ノード展開数に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1過去の MAPF クエリからのエージェント優先順位集合の再利用が、その後の L-MAPF インスタンスにおける計画時間を顕著に短縮できるか?
  • RQ2WL-DFS の深さ制限 ℓ が exPBS アルゴリズムの性能と安定性にどのように影響するか?
  • RQ3経験に基づく探索における、探索深さとフォールバック頻度の最適なバランスは何か?
  • RQ4PBS における経験に基づくウォームスターティングが、L-MAPF システムスループットに測定可能な改善をもたらすか?
  • RQ5幅制限とノード展開制限のパラメータ選択に、性能はどれほど敏感か?

主な発見

  • exRHCR は、テストされた L-MAPF インスタンス全体で RHCR と比較して平均実行時を最大39%短縮した。
  • WL-DFS における幅制限 ℓ=100 を使用すると、性能と安定性のバランスが最良となる。これは、過剰なフォールバックと過剰探索の両方を回避する。
  • ℓ=2 に設定すると、フォールバック頻度が高く(65%の頻度で)、オーバーヘッドが増加し、性能が低下する。
  • ℓ=1,000 に設定すると、フォールバックは最小限に抑えられるが、プライオリティツリーの探索が過剰になり、非効率な探索により実行時間が延長される。
  • ノードベースの制限は幅制限よりも効果が低く、ドメイン固有のパラメータにさらに敏感である。
  • 本手法により、同じ時間予算内でより多くのエージェントを処理できるようになり、システムスループットが向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。