Skip to main content
QUICK REVIEW

[논문 리뷰] Decomposed Soft Actor-Critic Method for Cooperative Multi-Agent Reinforcement Learning

Yuan Pu, Shaochen Wang|arXiv (Cornell University)|2021. 04. 14.
Reinforcement Learning in Robotics참고 문헌 18인용 수 12
한 줄 요약

이 논문은 협동적 다중 에이전트 강화 학습에서 효율적인 오프-폴리시 학습을 가능하게 하기 위해 가치 함수 분해와 소프트 액터-크리틱 원리를 융합한 새로운 다중 에이전트 소프트 액터-크리틱(mSAC) 방법을 제안한다. 선형 혼합 Q-네트워크, 탈중앙화된 확률적 정책, 그리고 선택적 사후적 우월도 함수를 활용함으로써 mSAC은 스타크래프트 II 미크로매니지먼트 과제에서 최신 기술 수준의 성능을 달성한다. 특히 2c_vs_64zg와 MMM2와 같은 큰 행동 공간 환경에서 COMA를 능가하고 QMIX와 유사한 성능을 기록한다.

ABSTRACT

Deep reinforcement learning methods have shown great performance on many challenging cooperative multi-agent tasks. Two main promising research directions are multi-agent value function decomposition and multi-agent policy gradients. In this paper, we propose a new decomposed multi-agent soft actor-critic (mSAC) method, which effectively combines the advantages of the aforementioned two methods. The main modules include decomposed Q network architecture, discrete probabilistic policy and counterfactual advantage function (optinal). Theoretically, mSAC supports efficient off-policy learning and addresses credit assignment problem partially in both discrete and continuous action spaces. Tested on StarCraft II micromanagement cooperative multiagent benchmark, we empirically investigate the performance of mSAC against its variants and analyze the effects of the different components. Experimental results demonstrate that mSAC significantly outperforms policy-based approach COMA, and achieves competitive results with SOTA value-based approach Qmix on most tasks in terms of asymptotic perfomance metric. In addition, mSAC achieves pretty good results on large action space tasks, such as 2c_vs_64zg and MMM2.

연구 동기 및 목표

  • 중앙집중적 훈련과 탈중앙적 실행(CTDE) 프레임워크 하에서 협동적 다중 에이전트 강화 학습(MARL)의 신용 할당 문제와 확장성 문제를 해결하기 위해.
  • 오프-폴리시 MARL를 위한 가치 함수 분해 접근법과 소프트 액터-크리틱의 샘플 효율성과 안정성 간의 통합을 위해.
  • 전체 정책 분포의 동시 최적화를 통해 고차원 행동 공간에서의 탐색과 정책 최적화를 향상시키기 위해.
  • 복잡한 다중 에이전트 신용 할당 시나리오에서 사후적 우월도 함수의 효과성을 조사하기 위해.
  • 정책 기반(예: COMA) 및 가치 기반(예: QMIX) 최신 기술 수준의 MARL 방법과 비교해도 경쟁력 있거나 슈퍼어리어한 성능을 달성하기 위해.

제안 방법

  • 합동 Q-값이 국부적 관측과 행동에만 조건화된 개별 Q-값의 선형 혼합으로 구성되는 분해된 Q-네트워크 아키텍처를 사용한다.
  • 각 에이전트에 대해 탈중앙화된 확률적 정책를 사용하며, 기대 수익과 엔트로피를 동시에 최대화하기 위해 소프트 액터-크리틱을 통해 학습한다.
  • 선택적 사후적 우월도 함수를 적용하여 개별 행동이 전역 수익에 미치는 영향을 추정함으로써 신용 할당을 향상시킨다.
  • 혼합 네트워크는 선형이며 전역 상태에만 조건화되어 있어 선형 분해의 이론적 조건을 충족시킨다.
  • 최대 엔트로피 강화 학습 프레임워크와 경험 재생을 활용하여 효율적인 오프-폴리시 학습을 지원한다.
  • 알고리즘은 CTDE 설정에서 훈련된다: 전역 상태 기반 중심화된 크리틱을 통한 가치 추정, 탈중앙적 실행을 통한 정책 추론.

실험 결과

연구 질문

  • RQ1소프트 액터-크리틱과 가치 함수 분해를 융합하면 협동적 MARL에서 안정적이고 샘플 효율적인 오프-폴리시 학습이 가능할까?
  • RQ2ε-그리디 또는 그리디 선택에 비해 고차원 행동 공간에서 전체 정책 분포를 사용한 탐색이 얼마나 효과적인가?
  • RQ3사후적 우월도 함수는 복잡하고 탐색하기 어려운 협동 작업에서 신용 할당과 성능을 향상시키는가?
  • RQ4mSAC은 스타크래프트 II 미크로매니지먼트 과제에서 정책 기반의 COMA와 가치 기반의 QMIX에 비해 성능 및 안정성 면에서 어떻게 비교되는가?
  • RQ5mSAC은 2c_vs_64zg와 MMM2와 같은 큰 행동 공간 환경으로 일반화할 수 있는가?

주요 결과

  • mSAC은 모든 스타크래프트 II 미크로매니지먼트 지ap에서 정책 기반 방법인 COMA를 크게 능가하며, 특히 점점 증가하는 승리율과 훈련 안정성에서 두드러진 성능을 보였다.
  • 표준 지도(예: 8m, 1c3s5z, 3m, 3s5z)에서 mSAC는 QMIX와 유사한 점점 증가하는 성능을 달성하여 최신 기술 수준의 가치 기반 방법과 경쟁력을 입증했다.
  • 2c_vs_64zg와 MMM2와 같은 큰 행동 공간 과제에서는 mSAC가 QMIX보다 유의미하게 뛰어난 성능을 기록하여 복잡한 행동 공간 시나리오에서의 우수성을 입증했다.
  • 전체 정책 분포를 사용한 탐색은 고차원 행동 공간에서 ε-그리디 전략보다 더 효과적이고 체계적인 탐색을 가능하게 했다.
  • 사후적 우월도 함수는 3s_vs_5z와 같은 더 어려운 과제에서 성능 향상을 이끌었지만, 쉬운 환경에서는 영향이 적어 복잡한 신용 할당 문제에서 가장 중요한 역할을 한다는 점을 시사했다.
  • 랜덤 시드에 따라 훈련 안정성이 달라지며, 일부 실험에서는 최대 90%의 승리율을 기록했고 다른 일부는 0%를 기록하여 어려운 지도에서 탐색이 여전히 도전 과제임을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.