Skip to main content
QUICK REVIEW

[논문 리뷰] MASER: Multi-Agent Reinforcement Learning with Subgoals Generated from Experience Replay Buffer

Jeewon Jeon, Woojun Kim|arXiv (Cornell University)|2022. 06. 20.
Smart Grid Energy Management인용 수 9
한 줄 요약

MASER는 경험 재생 버퍼에서 개별 Q-값과 총합 Q-값의 균형을 통해 자동으로 보조목표를 생성하는 다중에이전트 강화학습 방법을 제안한다. 이는 희박 보상 환경에서 효율적인 학습을 가능하게 하며, 가용 가능한 표현 학습을 통한 Q-함수 기반 내재 보상 기반으로 상태-기반 보상 설계 없이도 스타크래프트 II의 미세관리 작업에서 최신 다중에이전트 강화학습 알고리즘을 능가한다.

ABSTRACT

In this paper, we consider cooperative multi-agent reinforcement learning (MARL) with sparse reward. To tackle this problem, we propose a novel method named MASER: MARL with subgoals generated from experience replay buffer. Under the widely-used assumption of centralized training with decentralized execution and consistent Q-value decomposition for MARL, MASER automatically generates proper subgoals for multiple agents from the experience replay buffer by considering both individual Q-value and total Q-value. Then, MASER designs individual intrinsic reward for each agent based on actionable representation relevant to Q-learning so that the agents reach their subgoals while maximizing the joint action value. Numerical results show that MASER significantly outperforms StarCraft II micromanagement benchmark compared to other state-of-the-art MARL algorithms.

연구 동기 및 목표

  • 희박 보상 환경에서 협동 다중에이전트 강화학습의 샘플 효율성과 보상 할당 문제를 해결한다.
  • 과도한 태스크 특화 보조목표 설계의 한계를 극복하기 위해 경험 기반 자동 보조목표 생성을 가능하게 한다.
  • 개별 에이전트가 보조목표 향해 이동하도록 이끄는 내재 보상 설계와 동시에 일관된 Q-값 분해를 통한 공동 정책 최적화를 유지한다.
  • 밀도 높은 보상 설계나 도메인 특화 보조목표 설계에 의존하지 않고도 희박 보상 다중에이전트 환경에서 학습 효율성과 최종 성능을 향상시킨다.

제안 방법

  • 경험 재생 버퍼의 트레이젝터리에서 부분 상태를 선택하여 개별 Q-값과 총합 Q-값의 가중 조합 기반으로 보조목표를 생성한다.
  • CTDE(중앙집중적 훈련, 분산 실행) 프레임워크 하에서 일관된 Q-값 분해를 위해 믹싱 네트워크를 사용한다.
  • 표현 학습을 통해 학습된 Q-함수 기반의 가용 가능한 거리 측정을 활용해 각 에이전트의 내재 보상을 설계한다.
  • 내재 보상 신호가 실제 보조목표 달성과 일치하도록 하기 위해 손실 함수에 에피소드 보정을 도입하여 훈련을 안정화시킨다.
  • 개별 기여도의 안정적 학습을 확보하기 위해 개별 유용성에 대한 별도의 손실 항목을 통해 로컬 Q-네트워크를 업데이트한다.
  • 이중 목적 최적화를 적용하여 공동 Q-값을 최대화하면서도 가용 표현에서 유도된 내재 보상에 의해 에이전트가 보조목표를 향해 유도되도록 한다.

실험 결과

연구 질문

  • RQ1희박 보상 다중에이전트 강화학습에서 도메인 특화 지식에 의존하지 않고 경험 재생 버퍼에서 자동으로 보조목표를 생성할 수 있는가?
  • RQ2보조목표 선택 시 개별 Q-값과 총합 Q-값의 균형 조정이 학습 효율성과 최종 성능에 미치는 영향은 어떠한가?
  • RQ3가용 표현 기반 Q-함수 기반 내재 보상이 다중에이전트 희박 보상 환경에서 샘플 효율성을 얼마나 향상시키는가?
  • RQ4개별 손실 및 에피소드 보정 구성 요소가 MASER의 훈련 안정성과 성능에 기여하는 정도는 어떠한가?
  • RQ5MASER는 스타크래프트 II의 미세관리 작업과 같은 도전적인 희박 보상 환경에서 기존 최신 다중에이전트 강화학습 알고리즘을 능가하는가?

주요 결과

  • MASER는 2s3z, 3m, 8m, 2m_vs_1z를 포함한 스타크래프트 II의 미세관리 작업에서 최신 다중에이전트 강화학습 알고리즘을 뛰어넘는 성능을 보였다.
  • 개별 Q-값과 총합 Q-값을 모두 고려한 보조목표 선택(α=0.5)이 무작위 선택 또는 단일 Q-값 유형 사용보다 뛰어난 성능을 달성했다.
  • 절단 실험을 통해 개별 손실 및 에피소드 보정 구성 요소가 안정적이고 효과적인 훈련을 위해 필수적임을 확인했다.
  • Q-함수 기반의 가용 거리 표현은 효과적인 내재 보상 학습을 가능하게 하여, 기준 모델이 실패하는 3m-cliff 희박 보상 환경에서도 MASER가 성공할 수 있도록 했다.
  • 2s3z 작업에서의 보조목표 선택 시각화 분석을 통해 MASER는 도메인 지식에 부합하는 역할 기반 행동(예: 스트라이커는 거리에서 공격, 제일로트는 근접 전투)을 학습하는 것으로 나타났다.
  • 명시적 보상 설계나 사전 정의된 보조목표 없이도 효과적인 보상 할당과 역할 특화를 달성했으며, 다양한 희박 보상 작업에 대한 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.