Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Anytime Planning for Multi-Agent MDPs

Shushman Choudhury, Jayesh K. Gupta|arXiv (Cornell University)|2021. 01. 12.
Artificial Intelligence in Games참고 문헌 41인용 수 8
한 줄 요약

이 논문은 다중 에이전트 MDPs를 위한 확장 가능한 anytime 계획 알고리즘인 Factored Value MCTS with Max-Plus(FV-MCTS-MP)을 제안한다. 이 알고리즘은 정확한 Variable Elimination(Var-El) 대신 반복적 Max-Plus 동작 조율를 사용함으로써 동적 조율 그래프를 가능하게 하고 계산을 크게 줄인다. 정적 조율 그래프에서 기존 기준보다 성능이 유사하거나 뛰어나며, 48대 드론 배달 작업과 같이 이전에는 해결이 불가능했던 큰 규모의 문제에도 스케일링이 가능하다.

ABSTRACT

We present a scalable tree search planning algorithm for large multi-agent sequential decision problems that require dynamic collaboration. Teams of agents need to coordinate decisions in many domains, but naive approaches fail due to the exponential growth of the joint action space with the number of agents. We circumvent this complexity through an anytime approach that allows us to trade computation for approximation quality and also dynamically coordinate actions. Our algorithm comprises three elements: online planning with Monte Carlo Tree Search (MCTS), factored representations of local agent interactions with coordination graphs, and the iterative Max-Plus method for joint action selection. We evaluate our approach on the benchmark SysAdmin domain with static coordination graphs and achieve comparable performance with much lower computation cost than our MCTS baselines. We also introduce a multi-drone delivery domain with dynamic, i.e., state-dependent coordination graphs, and demonstrate how our approach scales to large problems on this domain that are intractable for other MCTS methods. We provide an open-source implementation of our algorithm at https://github.com/JuliaPOMDP/FactoredValueMCTS.jl.

연구 동기 및 목표

  • 에이전트 수가 증가함에 따라 공동 행동 공간이 기하급수적으로 증가하는 다중 에이전트 MDPs에서의 확장성 문제를 해결한다.
  • Monte Carlo Tree Search(MCTS)에서 정확한 조율 방법인 Variable Elimination(Var-El)의 한계를 극복한다. Var-El은 anytime 성질이 없고 동적 조율 그래프에서 어려움을 겪는다.
  • 공동 행동 선택을 위해 Var-El을 반복적 Max-Plus로 대체함으로써 상태에 따라 달라지는 조율 그래프를 지원하는 효율적이고 anytime 계획을 가능하게 한다.
  • 기존의(Multi-Drone Delivery)와 새로운(SysAdmin) MMDP 도메인에서 확장성과 성능을 입증한다. 이는 이전 MCTS 변형에서 해결이 불가능했던 문제들이다.
  • 재현성과 확장 가능한 다중 에이전트 계획 분야의 향후 연구를 지원하기 위해 실용적이고 오픈소스로 구현된 구현체를 제공한다.

제안 방법

  • 정확한 Variable Elimination(Var-El) 대신 공동 행동 선택을 위한 반복적 근사 방법인 Max-Plus를 Factored Value MCTS 프레임워크에 통합한다.
  • 조율 그래프를 통한 요소 표현을 사용해 국소적 에이전트 상호작용을 모델링함으로써 공동 가치 추정의 계산 부담을 줄인다.
  • 실시간에서 유망한 공동 행동 시퀀스를 탐색하기 위해 몬테카를로 트리 서치(MCTS)를 이용한 온라인 계획을 적용함으로써 anytime 동작을 가능하게 한다.
  • 각 결정 단계에서 상태에 따라 동적으로 조율 그래프를 구성하며, 거리 기준 이내이거나 같은 목표 영역에 할당된 에이전트 간에만 간선을 추가한다.
  • Max-Plus의 반복적 성질을 활용해 계산 시간과 해 품질 간의 트레이드오프를 가능하게 하여 anytime 계획을 지원한다.
  • JuliaPOMDP/FactoredValueMCTS.jl에서 알고리즘을 구현하여 효율적이고 분산 실행이 가능하게 하며, 대규모 MMDP 문제를 지원한다.

실험 결과

연구 질문

  • RQ1Max-Plus는 다중 에이전트 MDPs의 동적 조율 그래프를 갖는 anytime 계획을 가능하게 하기 위해 Factored Value MCTS에 효과적으로 통합될 수 있는가?
  • RQ2정적 조율 그래프 벤치마크에서 FV-MCTS-MP는 FV-MCTS-Var-El에 비해 성능과 계산 효율성에서 어떻게 비교되는가?
  • RQ3FV-MCTS-MP는 기존 MCTS 기반 방법이 처리할 수 없는 큰 다중 에이전트 문제의 동적 조율 그래프로 확장 가능한가?
  • RQ4정적 또는 고정된 그래프에 비해 동적 조율 그래프는 계획 성능과 메모리 사용에 어떤 영향을 미치는가?
  • RQ5FV-MCTS-MP는 48대 드론 배달과 같이 이전 방법이 메모리나 계산 제약으로 실패하는 대규모 다중 에이전트 조율 작업을 얼마나 잘 처리할 수 있는가?

주요 결과

  • 정적 조율 그래프를 갖는 SysAdmin 벤치마크에서 FV-MCTS-MP는 FV-MCTS-Var-El와 유사하거나 뛰어난 성능을 보이며, 평균 계획 시간을 약 40초에서 약 1초로 크게 단축시켰다.
  • FV-MCTS-MP는 Multi-Drone Delivery 도메인에서 48에이전트 문제로도 성공적으로 확장되었으며, 이는 FV-MCTS-Var-El과 표준 MCTS가 메모리 및 계산 제약으로 인해 해결이 불가능한 문제 크기이다.
  • Multi-Drone Delivery 도메인에서 FV-MCTS-MP는 누적 보상과 성공률 모두에서 MCTS 및 FV-MCTS-Var-El을 포함한 모든 기준보다 뛰어나며, 특히 큰 문제 크기에서 두드러진 성능 향상을 보였다.
  • FV-MCTS-MP에서 동적 조율 그래프의 사용은 정적 그래프보다 더 나은 성능을 이끌어내며, 필요한 순간에만 관련된 에이전트 간의 상호작용을 포착함으로써 불필요한 조율 오버헤드를 줄였다.
  • FV-MCTS-MP는 8에서 48에이전트까지의 모든 테스트 문제 크기에서 강력한 성능을 유지하였으며, 평균 조율 그래프 차수는 2.4에서 11.8 사이를 유지하여 강력한 확장성을 입증하였다.
  • 큰 문제에서 메모리 오버플로우 문제를 피했으며, FV-MCTS-Var-El과 표준 MCTS는 작은 인스턴스(예: 8에이전트)에서도 메모리 제약으로 실패했지만, FV-MCTS-MP는 안정적이고 효율적으로 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.