Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Multi-Agent Reinforcement Learning through Intelligent Information Aggregation

Siddharth Nayak, Kenneth Choi|arXiv (Cornell University)|2022. 11. 03.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 국소적 주변 정보를 지능적으로 집계함으로써 확장 가능하고 분산된 다중 에이전트 강화학습을 가능하게 하는 그래프 신경망 기반 아키텍처인 InforMARL을 제안한다. 이는 전역 정보 기반 베이스라인보다 뛰어난 샘플 효율성과 일반화 성능를 달성하면서도, 전역 관측 없이도 높은 성공률을 유지하여 탐색 및 조율 작업에서 탁월한 성능을 발휘한다.

ABSTRACT

We consider the problem of multi-agent navigation and collision avoidance when observations are limited to the local neighborhood of each agent. We propose InforMARL, a novel architecture for multi-agent reinforcement learning (MARL) which uses local information intelligently to compute paths for all the agents in a decentralized manner. Specifically, InforMARL aggregates information about the local neighborhood of agents for both the actor and the critic using a graph neural network and can be used in conjunction with any standard MARL algorithm. We show that (1) in training, InforMARL has better sample efficiency and performance than baseline approaches, despite using less information, and (2) in testing, it scales well to environments with arbitrary numbers of agents and obstacles. We illustrate these results using four task environments, including one with predetermined goals for each agent, and one in which the agents collectively try to cover all goals. Code available at https://github.com/nsidn98/InforMARL.

연구 동기 및 목표

  • 제한된 국소 관측과 분산 실행 조건에서 확장 가능한 다중 에이전트 탐색 문제를 해결하기 위해.
  • 전역 상태 정보에 의존하지 않고도 다중 에이전트 강화학습에서 샘플 효율성과 정책 이식성을 향상시키기 위해.
  • 다중 에이전트 강화학습에서 단순한 전역 상태 연결보다 국소 정보의 지능적인 집합이 더 우수한 성능을 낼 수 있음을 입증하기 위해.
  • 전역 관측 없이도 국소 관측만으로도 높은 성능을 달성할 수 있도록 효과적인 조율과 충돌 회피를 가능하게 하기 위해.
  • 그래프 기반 정보 집합이 다양한 다중 에이전트 탐색 작업에서 확장성과 성능 향상에 기여함을 보여주기 위해.

제안 방법

  • 다중 에이전트 강화학습(MARL) 프레임워크에서 에이전트 및 크리틱 네트워크의 국소 주변 정보를 인코딩하고 집계하기 위해 그래프 신경망(GNN)을 통합한다.
  • 환경을 그래프로 표현하며, 에이전트와 장애물을 노드로, 간선은 거리 기반 관계를 나타낸다.
  • GNN 메시지 전달 메커니즘을 사용하여 각 에이전트의 국소 관측에 대한 맥락 인식 기반의 집합 표현을 계산한다.
  • 기본 학습 파라다임을 수정하지 않고도 표준 MARL 알고리즘(예: RMAPPO)에 GNN 처리 정보를 통합한다.
  • 각 에이전트가 오직 자신의 국소 관측과 집합된 주변 벡터만을 기반으로 행동하도록 하여 분산 실행을 가능하게 한다.
  • 고정된 수의 에이전트로 학습한 후 다른 수의 에이전트로 테스트하는 방식으로 이식성을 지원한다.

실험 결과

연구 질문

  • RQ1전역 상태 기반 베이스라인과 비교해 볼 때, 국소 정보의 지능적인 집합이 다중 에이전트 강화학습에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2GNN 기반 정보 집합 모듈은 표준 MARL 알고리즘보다 미리 보지 않은 수의 에이전트에 대해 더 우수한 일반화 성능를 보일 수 있는가?
  • RQ3전체 관측 없이 국소 관측만으로 학습된 분산형 MARL 정책이 커버리지 및 형성과 같은 복잡한 조율 작업에서 높은 성능를 달성할 수 있는가?
  • RQ4더 적은 정보(국소 정보만)를 사용할 경우, 전역 상태를 사용하는 것보다 확장성과 낮은 샘플 복잡도를 달성할 수 있는가?
  • RQ5그래프 기반 표현이 탐색 및 충돌 회피에 있어 가장 관련 있는 환경 정보를 효과적으로 식별하고 활용할 수 있는가?

주요 결과

  • InforMARL은 3명과 7명의 에이전트로 구성된 모든 테스트 환경(Target, Coverage, Formation, Line)에서 100% 성공률를 기록했으며, 3명의 에이전트 시나리오로만 훈련된 경우에도 성공했다.
  • Target 환경에서 InforMARL은 약 39%의 에피소드 길이(T ≈ 0.39) 내에 목표에 도달하여 효율적인 탐색 능력을 입증했다.
  • Coverage 및 Formation 작업에서 InforMARL은 에피소드 길이의 0.30~0.43 범위 내에서 작업을 완료했으며, 국소 관측만을 사용함에도 불구하고 RMAPPO와 유사하거나 略적으로 뛰어난 성능를 보였다.
  • InforMARL은 전역 상태 모델보다 정보를 더 적게 사용함에도 불구하고, 훈련 과정에서 더 뛰어난 샘플 효율성을 보였다.
  • 다른 수의 에이전트에 대해 일반화가 효과적으로 이루어졌으며, 3명의 에이전트로 훈련한 후 7명의 에이전트로 테스트했을 때 성능 저하가 없었다.
  • InforMARL은 목표에 대한 공감이 필요한 작업(예: Formation, Line)을 포함한 모든 작업에서 높은 성능를 유지했으며, 최소한의 정보로도 복잡한 조율을 지원할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.