Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Experience in Lifelong Multi-Agent Pathfinding

Nitzan Madar, Kiril Solovey|arXiv (Cornell University)|2022. 02. 09.
Robotic Path Planning Algorithms인용 수 4
한 줄 요약

이 논문은 수명 주기 다중 에이전트 경로 찾기(L-MAPF)를 위한 새로운 접근법인 exRHCR를 제안한다. 이 방법은 이전에 얻은 해결 경험을 활용하여 계획을 가속화한다. 우선순위 기반 탐색(PBS)에 학습된 에이전트 우선순위 집합을 통한 경험 인식형 온도 시작(warm-starting)을 도입함으로써, exRHCR는 RHCR 대비 평균 실행 시간을 최대 39% 감소시켜 동적 작업 스트림에서 시스템 처리량을 크게 향상시킨다.

ABSTRACT

In Lifelong Multi-Agent Path Finding (L-MAPF) a team of agents performs a stream of tasks consisting of multiple locations to be visited by the agents on a shared graph while avoiding collisions with one another. L-MAPF is typically tackled by partitioning it into multiple consecutive, and hence similar, "one-shot" MAPF queries, as in the Rolling-Horizon Collision Resolution (RHCR) algorithm. Therefore, a solution to one query informs the next query, which leads to similarity with respect to the agents' start and goal positions, and how collisions need to be resolved from one query to the next. Thus, experience from solving one MAPF query can potentially be used to speedup solving the next one. Despite this intuition, current L-MAPF planners solve consecutive MAPF queries from scratch. In this paper, we introduce a new RHCR-inspired approach called exRHCR, which exploits experience in its constituent MAPF queries. In particular, exRHCR employs an extension of Priority-Based Search (PBS), a state-of-the-art MAPF solver. The extension, which we call exPBS, allows to warm-start the search with the priorities between agents used by PBS in the previous MAPF instances. We demonstrate empirically that exRHCR solves L-MAPF instances up to 39% faster than RHCR, and has the potential to increase system throughput for given task streams by increasing the number of agents a planner can cope with for a given time budget.

연구 동기 및 목표

  • 구조적으로 유사한 L-MAPF 쿼리를 반복적으로 처음부터 해결하는 데 따른 비효율성을 해결하기 위해.
  • 연속된 쿼리 간의 에이전트 출발/도착 위치 및 충돌 해결 패턴의 시간적 유사성을 활용하기 위해.
  • 이전 MAPF 해결 경험을 통합하여 RHCR 알고리즘의 효율성을 향상시키기 위해.
  • 반복적이고 유사한 MAPF 인스턴스에서 수렴 속도를 높이기 위한 PBS용 온도 시작 메커니즘을 개발하기 위해.

제안 방법

  • 이전에 학습된 에이전트 우선순위 집합으로 우선순위 트리를 초기화하는 exPBS로 PBS를 확장한다.
  • 탐색 폭을 제한하여 과도한 탐색을 방지하기 위해 너비 제한이 있는 깊이 우선 탐색(WL-DFS)을 사용하여 우선순위 트리를 탐색한다.
  • 너비 제한을 초과하거나 루트 우선순위 집합이 비가능한 경우 표준 PBS로의 패러다임 전환을 구현한다.
  • 연속된 MAPF 쿼리를 δ+1개의 배치로 묶어, 첫 번째는 PBS로 해결하고 나머지 δ개는 공유된 경험을 사용해 exPBS로 해결한다.
  • WL-DFS 탐색의 깊이를 제어하는 파라미터 ℓ를 도입하여 탐색 깊이와 포기 빈도 간의 트레이드오��� 조정을 가능하게 한다.
  • 실행 시간, PT 폭, 노드 확장 수에 대한 ℓ의 영향을 평가하기 위해 레이더 플롯과 분석 실험을 적용한다.

실험 결과

연구 질문

  • RQ1이전 MAPF 쿼리에서의 에이전트 우선순위 집합을 재사용함으로써, 후속 L-MAPF 인스턴스에서 계획 시간을 크게 단축시킬 수 있는가?
  • RQ2WL-DFS의 깊이 제한 ℓ가 exPBS 알고리즘의 성능과 안정성에 어떤 영향을 미치는가?
  • RQ3경험 기반 탐색에서 탐색 깊이와 패러다임 전환 빈도 사이의 최적 균형은 무엇인가?
  • RQ4PBS에서 경험 기반 온도 시작이 L-MAPF 시스템 처리량에 측정 가능한 향상을 가져오는가?
  • RQ5너비 제한 대비 노드 확장 수 제한과 같은 파라미터 선택에 대해 성능이 얼마나 민감한가?

주요 결과

  • exRHCR는 테스트된 모든 L-MAPF 인스턴스에서 RHCR 대비 평균 실행 시간을 최대 39% 감소시킨다.
  • WL-DFS에서 너비 제한 ℓ=100을 사용할 경우 성능과 안정성 사이의 최적 균형을 달성하여 과도한 패러다임 전환과 과도한 탐색을 방지한다.
  • ℓ=2로 설정할 경우 패러다임 전환이 빈번해져(65%의 비율로 발생) 오버헤드가 증가하고 성능이 저하된다.
  • ℓ=1,000으로 설정할 경우 패러다임 전환이 극히 적지만, 우선순위 트리 탐색이 지나치게 확장되어 비효율적 탐색으로 인해 실행 시간이 증가한다.
  • 노드 기반 제한은 너비 기반 제한보다 성능이 열등하고 도메인 특화 파라미터에 더 민감하다.
  • 이 방법은 동일한 시간 예산 내에 더 많은 에이전트를 처리할 수 있도록 하여 시스템 처리량을 증가시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.