Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Regularization via Noisy Advantage Values for Cooperative Multi-agent Actor-Critic methods

Jian Hu, Siyue Hu|arXiv (Cornell University)|2021. 06. 27.
Optimization and Search Problems인용 수 8
한 줄 요약

이 논문은 협동적 다중 에이전트 강화학습에서 정책 과적합을 방지하기 위해 가치 함수와 이점 함수에 각각 가우시안 노이즈를 주입하는 방식으로 정규화하는 Noisy-Value MAPPO (NV-MAPPO)와 Noisy-Advantage MAPPO (NA-MAPPO)를 제안한다. 이 방법은 SMAC에서 에이전트 전용 특징 없이도 최신 기준 성능을 달성하며, 어려운 시나리오에서 최대 97%의 승리 비율을 기록한다.

ABSTRACT

Recent works have applied the Proximal Policy Optimization (PPO) to the multi-agent cooperative tasks, such as Independent PPO (IPPO); and vanilla Multi-agent PPO (MAPPO) which has a centralized value function. However, previous literature shows that MAPPO may not perform as well as Independent PPO (IPPO) and the Fine-tuned QMIX on Starcraft Multi-Agent Challenge (SMAC). MAPPO-Feature-Pruned (MAPPO-FP) improves the performance of MAPPO by the carefully designed agent-specific features, which may be not friendly to algorithmic utility. By contrast, we find that MAPPO may face the problem of extit{The Policies Overfitting in Multi-agent Cooperation(POMAC)}, as they learn policies by the sampled advantage values. Then POMAC may lead to updating the multi-agent policies in a suboptimal direction and prevent the agents from exploring better trajectories. In this paper, to mitigate the multi-agent policies overfitting, we propose a novel policy regularization method, which disturbs the advantage values via random Gaussian noise. The experimental results show that our method outperforms the Fine-tuned QMIX, MAPPO-FP, and achieves SOTA on SMAC without agent-specific features. We open-source the code at \url{https://github.com/hijkzzz/noisy-mappo}.

연구 동기 및 목표

  • MAPPO에서 샘플된 이점 값에 정책이 과적합되는 문제를 해결하기 위해, 특히 협동적 다중 에이전트 강화학습에서 정책 과적합 문제를 다루는 것.
  • 이점 함수와 가치 함수에 노이즈를 도입하여 다중 에이전트 액터-크리틱 방법의 일반화 능력과 탐색 능력을 향상시키는 것.
  • 수동으로 설계된 에이전트 전용 특징에 의존하지 않고, 스타크래프트 다중 에이전트 챌린지(SMAC) 벤치마크에서 최고 성능을 달성하는 것.
  • 이점 함수에 노이즈를 주입하는 것이 특징 공학 기법과 단조성 제약 모델보다 단순하면서도 효과적인 정규화 전략임을 입증하는 것.

제안 방법

  • 학습 중 중심화된 가치 함수에 독립적인 가우시안 노이즈를 추가하여 정책 업데이트를 정규화하는 Noisy-Value MAPPO (NV-MAPPO)를 제안한다.
  • 정책 최적화에 사용되는 이점 값에 직접적으로 노이즈를 주입하는 Noisy-Advantage MAPPO (NA-MAPPO)를 도입한다.
  • 동일한 MAPPO 프레임워크를 사용하지만, 가치 함수 또는 이점 함수에 i.i.d. 가우시안 노이즈를 가하여 이점 추정 과정을 수정한다.
  • 정책 및 가치 함수 업데이트 시 모두 노이즈를 적용하며, 학습 안정성을 확보하면서 탐색을 장려하기 위해 노이즈 스케줄을 설계한다.
  • 동일한 정책을 중심으로 학습하고 분산 실행하는 CTDE(중앙집중적 학습, 분산 실행) 파라다임을 유지하면서 노이즈 기반 정규화를 추가한다.
  • 노이즈는 에p소드 및 에이전트 단위로 적용되어 정책 그래디언트 신호의 확률적 성격을 보장함으로써 특정 이점 추정에 대한 과적합을 방지한다.

실험 결과

연구 질문

  • RQ1협동적 다중 에이전트 강화학습에서 이점 또는 가치 함수에 노이즈를 주입하는 것이 정책 과적합을 완화할 수 있는가?
  • RQ2노이즈 기반 정규화가 MAPPO-FP와 같은 특징 공학 기법에 비해 성능과 알고리즘의 단순성 측면에서 뛰어나다는가?
  • RQ3단순한 노이즈 주입 방법이 에이전트 전용 특징이나 단조성 제약 없이도 SMAC에서 최고 성능을 달성할 수 있는가?
  • RQ4가치 또는 이점 함수에 노이즈가 다중 에이전트 환경에서 정책 엔트로피와 탐색 동역학에 어떤 영향을 미치는가?
  • RQ5QMIX가 단조성 제약으로 인해 실패하는 비단조성 환경에서도 제안된 방법이 일반화 가능한가?

주요 결과

  • NV-MAPPO는 모든 어려운 SMAC 시나리오에서 평균 승리 비율 97%를 기록하며, 최적화된 QMIX와 MAPPO-FP를 능가한다.
  • 에이전트 전용 특징을 사용하지 않아도 SMAC에서 최고 성능을 달성하여, 알고리즘적 유용성이 뛰어나다는 것을 입증한다.
  • NA-MAPPO는 시나리오 간 성능 변동성이 높아 이점 값에 노이즈를 주입하는 것이 학습을 불안정하게 만들 수 있음을 시사하지만, 여전히 기존 MAPPO를 능가한다.
  • NV-MAPPO는 정책 엔트로피 동역학을 크게 향상시켜, 3s5z_vs_3s6z 시나리오에서 볼 때 최적화되지 않은 정책로의 조기 수렴을 방지한다.
  • 가치 함수 추정에 변동성이 큰 시나리오(예: 3s5z_vs_3s6z)에서는 NV-MAPPO가 가장 큰 성능 향상을 보이며, 노이즈 유도 정규화와 성능 향상 간의 연관성을 확인한다.
  • 비단조성 행렬 게임 환경에서는 QMIX가 실패하는 상황에서도 NV-MAPPO가 QMIX를 능가함으로써, 이 방법이 QMIX가 단조성 제약으로 실패하는 환경에서도 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.