Skip to main content
QUICK REVIEW

[논문 리뷰] FCMNet: Full Communication Memory Net for Team-Level Cooperation in Multi-Agent Systems

Yutong Wang, Guillaume Sartoretti|arXiv (Cornell University)|2022. 01. 28.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

FCMNet는 다중 에이전트 강화학습을 위한 미분 가능한 통신 학습 프레임워크로, 방향성 순환 신경망을 사용하여 에이전트가 다단계 메시지를 교환하고 공유된 탈중앙화 정책을 학습할 수 있도록 한다. 이는 스타크래프트 II 미크로매니지먼트 작업에서 최신 통신 기반 방법들을 능가하며, 메시지 손실과 통신 장애에 대해 뛰어난 내성성을 보이며 실생활 로봇 응용 분야에서의 잠재력을 보여준다.

ABSTRACT

Decentralized cooperation in partially-observable multi-agent systems requires effective communications among agents. To support this effort, this work focuses on the class of problems where global communications are available but may be unreliable, thus precluding differentiable communication learning methods. We introduce FCMNet, a reinforcement learning based approach that allows agents to simultaneously learn a) an effective multi-hop communications protocol and b) a common, decentralized policy that enables team-level decision-making. Specifically, our proposed method utilizes the hidden states of multiple directional recurrent neural networks as communication messages among agents. Using a simple multi-hop topology, we endow each agent with the ability to receive information sequentially encoded by every other agent at each time step, leading to improved global cooperation. We demonstrate FCMNet on a challenging set of StarCraft II micromanagement tasks with shared rewards, as well as a collaborative multi-agent pathfinding task with individual rewards. There, our comparison results show that FCMNet outperforms state-of-the-art communication-based reinforcement learning methods in all StarCraft II micromanagement tasks, and value decomposition methods in certain tasks. We further investigate the robustness of FCMNet under realistic communication disturbances, such as random message loss or binarized messages (i.e., non-differentiable communication channels), to showcase FMCNet's potential applicability to robotic tasks under a variety of real-world conditions.

연구 동기 및 목표

  • 전역적으로는 불안정한 통신 채널이 존재하는 부분 관찰 가능한 다중 에이전트 시스템에서 팀 수준의 협업 문제를 해결하기 위해.
  • 에이전트들이 다단계 통신 프로토콜과 공유된 탈중앙화 정책을 함께 학습할 수 있도록 통신 학습 프레임워크를 개발하기 위해.
  • 메시지 손실, 이진화, 무작위 전송 순서와 같은 실제 통신 장애 상황에서도 내성성을 확보하기 위해.
  • 매 시간 단계에서 각 에이전트가 모든 다른 에이전트로부터 순차적으로 정보를 수신하고 처리할 수 있도록 하여 글로벌 협업을 향상시키기 위해.
  • 공동 보상 및 개별 보상 다중 에이전트 환경 모두에서 방법의 효과성을 입증하기 위해.

제안 방법

  • FCMNet는 다수의 방향성 순환 신경망(RNN)을 사용하여 에이전트 간 메시지를 인코딩하고 전송하며, 은닉 상태와 셀 상태를 통신 신호로 활용한다.
  • 각 에이전트는 자신의 관측치를 자체 메모리로 유지하고, 매 시간 단계에서 고정된 다단계 순서로 모든 다른 에이전트로부터 메시지를 수신한다.
  • 에이전트 간 가중치 공유를 통해 공동 학습을 가능하게 하고 정책 대칭성을 보장함으로써 탈중앙화 실행을 지원한다.
  • 통신 과정이 미분 가능하므로 정책 기반 방법을 통해 중심화된 학습과 탈중앙화 실행(CTDE) 방식으로 엔드 투 엔드 학습이 가능하다.
  • 프레임워크는 다단계 메시지 전달을 지원하여 에이전트가 시간이 지남에 따라 모든 동료의 정보를 누적하고 추론할 수 있도록 한다.
  • 내성성은 학습 및 추론 과정에서 메시지 이진화, 무작위 메시지 손실, 무작위 전송 순서를 도입하여 평가된다.

실험 결과

연구 질문

  • RQ1미분 가능한 통신 학습 프레임워크는 전역적으로는 불안정한 통신이 존재하는 부분 관찰 가능한 다중 에이전트 환경에서 팀 수준의 협업을 향상시킬 수 있는가?
  • RQ2복잡한 미크로매니지먼트 작업에서 FCMNet은 최신 통신 기반 및 가치 분해 방법과 비교해 어떻게 성능을 내는가?
  • RQ3메시지 손실 및 이진화된 메시지와 같은 실제 통신 장애 상황에서 FCMNet의 성능 유지 범위는 어느 정도인가?
  • RQ4메시지 전송 순서를 무작위화하면 FCMNet의 학습 안정성이나 최종 성능에 영향을 미치는가?
  • RQ5통신이 노이즈가 많거나 불완전한 상황에서도 FCMNet는 안정적이고 높은 성능을 내는 협업 정책을 학습할 수 있는가?

주요 결과

  • FCMNet는 평가된 모든 스타크래프트 II 미크로매니지먼트 작업에서 최신 통신 기반 강화학습 방법들을 모두 능가한다.
  • 일부 작업에서는 FCMNet가 탈중앙화된 협업 다중 에이전트 강화학습에서 뛰어난 성능을 보이는 가치 분해 방법들과 유사한 성능을 달성한다.
  • 메시지 손실 확률이 3% 이하일 경우 FCMNet는 안정적인 학습과 높은 성능 유지를 유지하며, 수렴 속도나 최종 에피소드 길이에 변화가 없다.
  • 메시지 손실 확률이 3.5%를 초과하면 학습이 불안정해지며, 에이전트 및 크리틱 손실이 수렴하지 않아 성능 붕괴 임계점에 도달함을 나타낸다.
  • 메시지 전송 순서를 무작위화해도 성능 저하가 없으며, 오히려 메시지 다양성이 증가해 수렴 속도가 향상될 수 있다.
  • 최대 3%의 메시지 손실을 견디며 훈련된 에이전트는 이동하는 목표물을 정확히 추적하고 도달할 수 있으나, 손실률이 높아지면 정밀한 목표 추적을 유지하기 어려워진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.