Skip to main content
QUICK REVIEW

[논문 리뷰] A Maximum Mutual Information Framework for Multi-Agent Reinforcement Learning

Woojun Kim, Whiyoung Jung|arXiv (Cornell University)|2020. 06. 04.
Reinforcement Learning in Robotics참고 문헌 29인용 수 6
한 줄 요약

이 논문은 다중 에이전트 강화 학습(MARL)을 위한 최대 상호정보량(MMI) 프레임워크를 제안하며, 에이전트의 행동 간 상호정보량을 정규화하여 누적 수익을 보정함으로써 협업 행동을 향상시킵니다. 잠재 변수와 변분 추론을 사용하여 정책 최적화를 위한 계산 가능한 하한을 유도하고, 이로 인해 VM3-AC 알고리즘을 도출합니다. 이 알고리즘은 다중 워커 및 사냥개-사냥개 환경과 같은 협업이 요구되는 과제에서 MADDPG, I-SAC, MA-SAC를 능가합니다.

ABSTRACT

In this paper, we propose a maximum mutual information (MMI) framework for multi-agent reinforcement learning (MARL) to enable multiple agents to learn coordinated behaviors by regularizing the accumulated return with the mutual information between actions. By introducing a latent variable to induce nonzero mutual information between actions and applying a variational bound, we derive a tractable lower bound on the considered MMI-regularized objective function. Applying policy iteration to maximize the derived lower bound, we propose a practical algorithm named variational maximum mutual information multi-agent actor-critic (VM3-AC), which follows centralized learning with decentralized execution (CTDE). We evaluated VM3-AC for several games requiring coordination, and numerical results show that VM3-AC outperforms MADDPG and other MARL algorithms in multi-agent tasks requiring coordination.

연구 동기 및 목표

  • 실행 중 명시적 통신이나 의존성 없이 다중 에이전트 강화 학습(MARL)에서 협업 행동을 학습하는 데 도전하는 것.
  • 독립적 학습과 분해 가능한 정책의 한계를 극복하여 협동적 MARL에서의 협업을 저해하는 것.
  • 암묵적으로 협업 행동을 촉진하는 상호정보량 정규화를 통한 계산 가능하고 확장 가능한 프레임워크 개발.
  • 중앙집중적 훈련과 분산 실행(CTDE) 프레임워크 내에서 상호정보량 정규화를 정책 최적화 과정에 통합하는 것.

제안 방법

  • 에이전트 행동 간 비영인 상호정보량을 유도하기 위해 잠재 변수를 도입하여 명시적 통신 없이도 협업 행동을 가능하게 합니다.
  • 불변분포가 존재할 경우 상호정보량 정규화를 계산 가능하게 하기 위해 변분 하한을 적용합니다.
  • 누적 수익과 행동 간 상호정보량을 조합한 MMI-정규화 목적함수의 하한을 도출합니다.
  • 유도된 하한을 최대화하기 위해 정책 반복을 사용하여 변분 최대 상호정보량 다중에이전트 액터-크리틱(VM3-AC) 알고리즘을 도출합니다.
  • 중앙집중적 훈련과 분산 실행(CTDE)을 적용하여 훈련 시에는 전체 정보에 액세스할 수 있고, 배포 시에는 현지 관측에 기반해 행동하도록 합니다.
  • 상호정보량 정규화와 엔트로피 정규화를 결합하고 중앙집중적 크리틱을 사용하여 탐색과 협업을 향상시킵니다.

실험 결과

연구 질문

  • RQ1에이전트 행동 간 상호정보량이 다중 에이전트 강화 학습에서 협업을 향상시키는 데 효과적으로 활용될 수 있는가?
  • RQ2분산 정책과 명시적 통신이 없는 MARL 환경에서 상호정보량 정규화를 어떻게 계산 가능하게 할 수 있는가?
  • RQ3목적함수에 상호정보량을 통합함으로써 기존 방법에 비해 협업이 요구되는 MARL 과제에서 성능 향상이 이루어지는가?
  • RQ4잠재 변수와 온도 하이퍼파rameter β가 학습된 정책의 협업과 성능에 미치는 영향은 무엇인가?

주요 결과

  • VM3-AC는 다중 워커, 사냥개-사냥개, 협동 항법 과제를 포함한 여러 협업이 요구되는 환경에서 MADDPG, I-SAC, MA-AC, MA-SAC를 모두 능가합니다.
  • N=4 에이전트가 포함된 다중 워커 환경에서 VM3-AC는 뚜렷한 성능 향상을 보이며 고수준 협업 상황에서의 효과성을 입증합니다.
  • 제거 실험 결과 잠재 변수가 협업에 필수적임을 확인하였으며, N=3 및 N=4 다중 워커 설정 모두에서 이를 제거하면 성능이 저하됩니다.
  • 온도 파rameter β는 보상과 상호정보량 사이의 트레이드오프를 제어하며, 최적 성능는 β ≈ 0.05–0.1 범위에서 관찰됩니다.
  • 보조 자료에서 보듯이 VM3-AC는 평가된 환경에서 최신 기술인 MAVEN 알고리즘을 크게 능가합니다.
  • 상호정보량 정규화와 엔트로피 정규화의 조합은 각각 별개로 적용할 경우보다 더 나은 협업 성능을 보이며 상호보완적 이점이 있음을 시사합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.