Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Implicit Coordination Graphs for Multi-agent Reinforcement Learning

Sheng Li, Jayesh K. Gupta|arXiv (Cornell University)|2020. 06. 19.
Reinforcement Learning in Robotics참고 문헌 50인용 수 38
한 줄 요약

DICG는 자기 주의와 그래프 컨볼루션을 통해 동적 암시적 조정 그래프를 학습하여 중앙집중식과 분산식 MARL 간의 균형을 맞추고, 포식자-피식자, SMAC, 그리고 교통 신호 교차로 과제에서 협력을 개선한다.

ABSTRACT

Multi-agent reinforcement learning (MARL) requires coordination to efficiently solve certain tasks. Fully centralized control is often infeasible in such domains due to the size of joint action spaces. Coordination graph based formalization allows reasoning about the joint action based on the structure of interactions. However, they often require domain expertise in their design. This paper introduces the deep implicit coordination graph (DICG) architecture for such scenarios. DICG consists of a module for inferring the dynamic coordination graph structure which is then used by a graph neural network based module to learn to implicitly reason about the joint actions or values. DICG allows learning the tradeoff between full centralization and decentralization via standard actor-critic methods to significantly improve coordination for domains with large number of agents. We apply DICG to both centralized-training-centralized-execution and centralized-training-decentralized-execution regimes. We demonstrate that DICG solves the relative overgeneralization pathology in predatory-prey tasks as well as outperforms various MARL baselines on the challenging StarCraft II Multi-agent Challenge (SMAC) and traffic junction environments.

연구 동기 및 목표

  • 다중 에이전트 RL에서 공동 행동 공간이 크고 정적 조정 그래프가 충분하지 않은 상황에서 더 나은 조정의 필요성을 제시합니다.
  • 관찰로부터 동적 조정 그래프를 추론하고 그래프 신경망을 사용해 공동 행동 값이나 행동을 계산하는 DICG를 소개합니다.
  • CTCE(중앙집중 학습-중앙집행) 및 CTDE(중앙집중 학습-분산 실행) 체제를 통해 중앙화와 분산 실행 간의 절충을 가능하게 합니다.
  • DICG가 상대적 과일반화를 완화하고 SMAC 및 교통 신호 교차로와 같은 복잡한 MARL 작업에서 베이스라인을 능가한다는 것을 보여줍니다.

제안 방법

  • 에이전트 임베딩으로부터 인접 행렬 M을 갖는 암시적이며 소프트한 조정 그래프를 학습하기 위해 자기 주의 모듈을 사용한다.
  • 에이전트 간 정보를 전달하고 통합하기 위해 M에 그래프 컨볼루션을 적용한다.
  • 두 가지 사용 모드를 제공한다: 중앙집중 학습-중앙집행(CTCE)을 위한 DICG-CE와 중앙집중 학습-분산 실행(CTDE) 및 중앙 집중 기준선과 함께하는 DICG-DE.
  • 공동 행동 또는 중앙 기반선을 이용한 이점 추정을 위해 표준.actor-critic 방법(PPO)으로 전체 DICG 모듈을 엔드투엔드로 학습한다.
  • 인코더는 관찰 o_i로부터 임베딩 e_i를 생성하기 위해 에이전트 간 매개변수를 공유하며, 이는 μ_ij = softmax_j attention(e_i, e_j)를 계산하는 데 사용된다.
  • 최종 임베딩 Ê는 m개의 그래프 컨볼루션 층 이후 E(0)에 잔차 연결으로 형성된다.
  • DICG-CE는 Ê를 사용해 에이전트의 행동을 생성하고, DICG-DE는 Ê를 사용해 이점 추정을 위한 중앙 집중 크리틱 기준선을 추정한다.

실험 결과

연구 질문

  • RQ1동적으로 학습된 암시적 조정 그래프가 도메인 특화 휴리스틱 없이 다중 에이전트 조정을 향상시킬 수 있는가?
  • RQ2주의 기반 그래프 구조를 GCN과 통합하면 MARL 작업에서 상대적 과일반화를 완화할 수 있는가?
  • RQ3DICG는 CTCE 및 CTDE 체제에서 완전한 중앙집중 또는 분산 기반 베이스라인과 비교하여 어떤 성능을 보이는가?
  • RQ4DICG 임베딩이 원시 관찰값보다 다른 에이전트의 행동이나 값을 예측하는 데 더 정보성이 있는가?

주요 결과

  • DICG는 완전한 중앙집중형 또는 분산형 방법이 어려움을 겪는 포식자-피식자 환경에서 상대적 과일반화를 해결한다.
  • DICG는 SMAC 시나리오 및 교통 신호 교차로에서 승률 및 샘플 효율성 측면에서 베이스라인보다 우수하다.
  • 학습된 주의 가중치는 협력 요구에 적응한다(예: 벌점이 증가할수록 더 먼 에이전트에 높은 주의 필요).
  • Post-DICG 임베딩은 DICG 이전 임베딩보다 다른 에이전트의 행동을 더 잘 예측하여 성공적인 암시적 조정 추론을 시사한다.
  • SMAC에서 DICG-DE-LSTM은 여러 맵에서 가장 높은 및 가장 안정적인 승률을 달성하며 DCG, VDN, QMIX 베이스라인을 능가한다.
  • 교통 신호 교차로에서 DICG-DE-MLP는 중간 및 어려운 모드에서 강력한 성능을 보이며 여러 분산 기반 베이스라인과 일부 중앙 집중 베이스라인을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.