Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Heuristic Multi-Agent Path Finding with Communication

Ziyuan Ma, Yudong Luo|arXiv (Cornell University)|2021. 06. 21.
Reinforcement Learning in Robotics참고 문헌 38인용 수 6
한 줄 요약

이 논문은 분산 히ュ리스틱 다중 에이전트 경로 찾기 통신(DHC)을 제안한다. 이는 그래프 컨volutional 통신과 모든 잠재적 최단 경로에서 유도된 히ュ리스틱 가이던스를 사용하는 딥 Q-러닝 방법으로, 중앙집중식 계획 없이도 탈중앙화되고 확장 가능하며 협동적인 다중 에이전트 경로 찾기를 가능하게 한다. 이는 충돌을 피하고 합리적인 경로 선택 및 협동 행동을 학습함으로써 희박한 환경과 혼잡한 환경 모두에서 높은 성공률과 낮은 평균 단계를 달성한다.

ABSTRACT

Multi-Agent Path Finding (MAPF) is essential to large-scale robotic systems. Recent methods have applied reinforcement learning (RL) to learn decentralized polices in partially observable environments. A fundamental challenge of obtaining collision-free policy is that agents need to learn cooperation to handle congested situations. This paper combines communication with deep Q-learning to provide a novel learning based method for MAPF, where agents achieve cooperation via graph convolution. To guide RL algorithm on long-horizon goal-oriented tasks, we embed the potential choices of shortest paths from single source as heuristic guidance instead of using a specific path as in most existing works. Our method treats each agent independently and trains the model from a single agent's perspective. The final trained policy is applied to each agent for decentralized execution. The whole system is distributed during training and is trained under a curriculum learning strategy. Empirical evaluation in obstacle-rich environment indicates the high success rate with low average step of our method.

연구 동기 및 목표

  • 동시 이동을 하는 대규모 부분 관찰 다중 에이전트 환경에서 충돌 없는 협동 정책을 학습하는 데 도전하는 것.
  • 모든 최단 경로에서 유도된 히ュ리스틱 가이던스를 통합함으로써 장기적인 목표 지향 작업에서 딥 강화학습의 일반화 및 확장성을 향상시키는 것.
  • 그래프 컨볼루션을 사용한 탈중앙화된 통신을 통해 혼잡한 환경에서의 효율적인 협동을 가능하게 하는 것.
  • 공동 행동 가치 학습 없이도 대규모 수의 에이전트에 확장 가능한 단일 재사용 가능한 정책을 훈련하는 것.
  • 샘플 효율성과 수렴성을 향상시키기 위해 분산형이고 커리큘럼 기반의 훈련 프레임워크를 개발하는 것.

제안 방법

  • 모든 에이전트의 관측에는 장애물 위치, 인접한 에이전트 위치, 예측된 목표 위치, 그리고 에이전트 자신의 목표 위치가 포함된 딥 Q-네트워크를 사용한다.
  • 히ュ리스틱 가이던스는 에이전트의 출발지에서 목표지까지의 모든 잠재적 최단 경로를 채널로 삽입하여 학습을 통해 합리적인 경로 선택을 가능하게 한다.
  • 다중 헤드 어텐션을 사용한 그래프 컨볼루션을 통해 상호 에이전트 관계를 모델링하고 인접한 에이전트 간의 통신을 가능하게 한다.
  • 에이전트들은 단일 에이전트 관점에서 독립적으로 훈련되며, 분산 Ape-X 프레임워크와 커리큘럼 학습을 사용하여 모델을 훈련한다.
  • 추론 중에는 모든 에이전트가 동일한 탈중앙화된 정책을 실행하며 동시에 이동하고 목표에 도달한 후에도 환경에 머물러 있다.
  • 중앙집중식 계획 없이도 단일 경로 형태화나 전문가 시범에 의존하지 않아 일반화 능력이 향상된다.

실험 결과

연구 질문

  • RQ1모든 잠재적 최단 경로에서 유도된 히ュ리스틱 가이던스는 장기적인 다중 에이전트 경로 찾기에서 샘플 효율성과 성능을 향상시키는가?
  • RQ2그래프 컨볼루션을 통한 탈중앙화된 통신은 혼잡한 다중 에이전트 환경에서 협동성을 향상시키고 충돌을 줄이는가?
  • RQ3공동 행동 가치 학습 없이도 단일 에이전트로 훈련된 정책이 공동 행동 가치 학습 없이도 대규모 탈중앙화 다중 에이전트 시스템에 효과적으로 일반화되는가?
  • RQ4히ュ리스틱 가이던스와 통신의 조합이 희박한 환경과 혼잡한 환경 모두에서 성공률과 경로 효율성에 어떤 영향을 미치는가?
  • RQ5커리큘럼 학습과 분산 훈련은 대규모 다중 에이전트 경로 찾기 작업에서 수렴성과 확장성 향상에 얼마나 기여하는가?

주요 결과

  • 64명의 에이전트와 30%의 장애물 밀도를 가진 40×40 지도에서 DHC는 성공률 92.5%와 평균 단계 수 163.50을 기록했으며, PRIMAL(170.48단계)과 베이스라인(170.48단계)을 크게 능가했다.
  • 128명의 에이전트와 30%의 장애물 밀도를 가진 80×80 지도에서 DHC는 성공률 91.2%와 평균 단계 수 163.50을 기록했고, PRIMAL는 321.63단계를 소비하여 더 뛰어난 확장성과 효율성을 보였다.
  • 절단 실험 결과, 히ュ리스틱 가이던스를 제거하면 장기적인 경로 찾기 작업에서 성능이 급격히 떨어졌으며, 이는 경로 선택 가이던스로서의 핵심적 역할을 확인했다.
  • 통신 구성요소(그래프 컨볼루션)는 협착 환경(예: 40×40 지도에서 64명의 에이전트)에서 성공률을 최대 20% 향상시켜 협동의 효과성을 입증했다.
  • DHC는 40×40에서 80×80 지도로 확장할 때 단계 수를 134.42에서 163.50으로 증가시켰지만, PRIMAL는 250.07에서 321.63으로 증가시켜 더 나은 환경 일반화 능력을 보였다.
  • DHC/Comm 변형(통신 기능 제거)은 혼잡한 시나리오에서 빈약한 성능을 보여, 통신이 혼잡도 관리와 사각지대 방지를 위해 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.