Skip to main content
QUICK REVIEW

[논문 리뷰] Empirical Policy Optimization for $n$-Player Markov Games

Yuanheng Zhu, Dongbin Zhao|arXiv (Cornell University)|2021. 10. 18.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 n명의 플레이어로 구성된 마르코프 게임에 대해 분산형이며 이력 누적 정책 최적화 프레임워크를 제안하며, 이는 근사 넷저 균형에 대해 증명 가능하게 수렴함을 보여준다. 즉각적인 보상이 아닌 누적된 이력 성과를 기반으로 정책을 진화시킴으로써, 비정상적인 다중 에이전트 환경에서도 안정성과 수렴성을 보장하며, 소규모 게임과 딥 강화학습을 사용한 대규모 펭귄 환경에서의 실험적 검증을 수행하였다.

ABSTRACT

In single-agent Markov decision processes, an agent can optimize its policy based on the interaction with environment. In multi-player Markov games (MGs), however, the interaction is non-stationary due to the behaviors of other players, so the agent has no fixed optimization objective. In this paper, we treat the evolution of player policies as a dynamical process and propose a novel learning scheme for Nash equilibrium. The core is to evolve one's policy according to not just its current in-game performance, but an aggregation of its performance over history. We show that for a variety of MGs, players in our learning scheme will provably converge to a point that is an approximation to Nash equilibrium. Combined with neural networks, we develop the \emph{empirical policy optimization} algorithm, that is implemented in a reinforcement-learning framework and runs in a distributed way, with each player optimizing its policy based on own observations. We use two numerical examples to validate the convergence property on small-scale MGs with $n\ge 2$ players, and a pong example to show the potential of our algorithm on large games.

연구 동기 및 목표

  • 다른 플레이어의 정책이 변화함에 따라 각 에이전트의 최적화 목적이 변화하는 비정상적인 n명의 플레이어로 구성된 마르코프 게임에서의 비정상성 문제를 해결하기 위해.
  • 다른 플레이어의 전략이나 플레이어 수를 알지 못해도 넷저 균형으로 수렴할 수 있는 학습 체계를 개발하기 위해.
  • 대규모 게임에 적합한 딥 신경망과 호환되는 확장 가능한 분산 강화학습 프레임워크를 설계하기 위해.
  • 리아푸노프 안정성 이론과 고정점 이론을 사용하여 제안된 연속시간 학습 동역학이 넷저 분포로 수렴하는 이론적 수렴성을 증명하기 위해.

제안 방법

  • 각 플레이어가 현재 수익이 아닌 누적된 이력 성과를 기반으로 정책을 업데이트하는 연속시간 학습 동역학(CTLD)을 수립함.
  • 리아푸노프 안정성 이론과 고정점 정리 이론을 적용하여 CTLD가 다양한 n명의 플레이어로 구성된 마르코프 게임에서 넷저 분포로 수렴함을 증명함.
  • 정책을 신경망으로 표현하고 전체 이력 경험을 기반으로 강화학습을 통해 파라미터를 학습하는 경험 기반 정책 최적화(EPO) 알고리즘을 개발함.
  • 각 플레이어가 다른 플레이어의 전략을 알 필요 없이 자신의 관측만으로 행동하는 분산 방식으로 EPO 알고리즘을 구현함.
  • 이력 경험을 저장하고 활용하기 위해 리PLAY 버퍼를 사용하여 과거에 효과적이었던 전략을 忘却 방지하는 정책 업데이트를 가능하게 함.
  • 정책 집단의 2차원 시각화를 위해 슈어 분해(Schur decomposition)를 활용하여 수렴 패턴과 정책 진화를 분석함.

실험 결과

연구 질문

  • RQ1비정상적인 환경에서 n명의 플레이어로 구성된 마르코프 게임에서 정책 최적화 체계가 넷저 균형으로 수렴할 수 있는가?
  • RQ2이력 성과를 집계함으로써 온정책 또는 자기대전(self-play) 방법에 비해 수렴 성능가 향상되는가?
  • RQ3일반적인 n명의 플레이어 게임에서 제안된 연속시간 학습 동역학의 이론적 수렴 보장 조건은 무엇인가?
  • RQ4EPO 알고리즘이 소규모 및 대규모 게임에서 기존 기준 모델인 PPO, NFSP, PSRO와 비교해 어떻게 성능을 내는가?
  • RQ5전체 이력 경험을 유지함으로써 정책 忘却를 방지하고 균형 수렴을 향상시키는 데 얼마나 기여하는가?

주요 결과

  • 제안된 연속시간 학습 동역학(CTLD)은 리아푸노프 안정성 이론과 고정점 분석을 통해 다양한 n명의 플레이어로 구성된 마르코프 게임에서 넷저 분포로 증명 가능하게 수렴함을 입증함.
  • 경험 기반 정책 최적화(EPO)는 수렴 속도와 균형 품질 면에서 PPO, 자기대전, NFSP, PSRO를 모두 초월하며, 초기 학습 단계에서 EPO의 상대적 성능 곡선이 기준선 이하로 내려가는 유일한 알고리즘이었음.
  • 전체 이력 재생 기능을 갖춘 EPO는 단조적 또는 전이적 정책 향상이 이루어지나, 제한된 재생 기능은 순환 행동과 정책 忘却를 유도함을 슈어 분해를 통해 시각화함.
  • Wimblepong 환경에서 ε = 0.1을 사용한 EPO는 기준 모델들에 비해 뛰어난 성능을 보이며, 대규모 게임에서의 확장성과 효과성을 입증함.
  • 제거 실험(ablation study) 결과, 전체 이력 경험은 안정적인 수렴에 필수적이며, 제한된 이력 재생은 불안정성과 최적화되지 않은 정책 진화를 유도함을 확인함.
  • EPO의 분산 구조는 다른 플레이어의 전략을 알 필요 없이 국소 관측만으로도 작동하므로, 협력이 제한된 실세계 응용에 실용적임.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.