Skip to main content
QUICK REVIEW

[논문 리뷰] When Can We Learn General-Sum Markov Games with a Large Number of Players Sample-Efficiently?

Ziang Song, Mei Song|arXiv (Cornell University)|2021. 10. 08.
Reinforcement Learning in Robotics참고 문헌 57인용 수 7
한 줄 요약

이 논문은 다수의 플레이어가 참여하는 일반합 마르코프 게임에서 균형을 학습하기 위한 표본 효율적인 알고리즘을 제안한다. 균형 개념으로는 균형의 수렴성에 대해 플레이어당 행동 수에 다항적 의존도를 가지며, 일반합 마르코프 게임에서의 나시 균형 학습에 대해 총 행동 수에 선형 의존도를 가지며, 이는 기존의 지수적 복잡도에 비해 크게 향상된 결과를 얻는다.

ABSTRACT

Multi-agent reinforcement learning has made substantial empirical progresses in solving games with a large number of players. However, theoretically, the best known sample complexity for finding a Nash equilibrium in general-sum games scales exponentially in the number of players due to the size of the joint action space, and there is a matching exponential lower bound. This paper investigates what learning goals admit better sample complexities in the setting of $m$-player general-sum Markov games with $H$ steps, $S$ states, and $A_i$ actions per player. First, we design algorithms for learning an $ε$-Coarse Correlated Equilibrium (CCE) in $\widetilde{\mathcal{O}}(H^5S\max_{i\le m} A_i / ε^2)$ episodes, and an $ε$-Correlated Equilibrium (CE) in $\widetilde{\mathcal{O}}(H^6S\max_{i\le m} A_i^2 / ε^2)$ episodes. This is the first line of results for learning CCE and CE with sample complexities polynomial in $\max_{i\le m} A_i$. Our algorithm for learning CE integrates an adversarial bandit subroutine which minimizes a weighted swap regret, along with several novel designs in the outer loop. Second, we consider the important special case of Markov Potential Games, and design an algorithm that learns an $ε$-approximate Nash equilibrium within $\widetilde{\mathcal{O}}(S\sum_{i\le m} A_i / ε^3)$ episodes (when only highlighting the dependence on $S$, $A_i$, and $ε$), which only depends linearly in $\sum_{i\le m} A_i$ and significantly improves over existing efficient algorithm in the $ε$ dependence. Overall, our results shed light on what equilibria or structural assumptions on the game may enable sample-efficient learning with many players.

연구 동기 및 목표

  • 다수 플레이어의 일반합 마르코프 게임에서 표본 효율적인 학습이 가능한 균형 개념 또는 게임 구조는 무엇인가?
  • 나시 균형 학습에서 연합 행동 공간 크기에 따른 지수적 표본 복잡도 장벽을 극복하는 것.
  • 개별 행동 수에 다항적 의존도를 가지는 알고리즘 설계, 즉 지수적 곱 의존도가 아닌 것.
  • 구조화된 게임에서 나시 균형 학습의 표본 복잡도에서 ε에 대한 의존도를 향상시키는 것.

제안 방법

  • CCE-V-학습을 위해 다수 플레이어 환경에 적응한 나시 V-학습을 사용하여 가치 함수 추정과 정책 갱신을 수행한다.
  • 혼합 전문가 Follow-The-Regularized-Leader 하위루틴을 사용하여 적대적 밴딧 프레임워크 내에서 가중치가 부여된 스왑 불만을 최소화하는 CE-V-학습을 설계한다.
  • 예측 가능한 가중치와 가중치 스왑 불만을 갖는 적대적 밴딧에 대해 새로운 분석 기법을 도입하여 저불만 학습을 가능하게 한다.
  • 잠재 함수 분해를 통해 일반합 마르코프 퍼텐셜 게임에서의 나시 균형 학습을 단일 에이전트 강화학습으로 환원한다.
  • 시간에 따라 변하는 가중치와 정규화를 사용한 가중치 불만 최소화 프레임워크를 도입하여 CE 수렴 보장.
  • 합집합 경계와 마르팅게일 집중을 사용하여 정책 그래디언트 및 가치 함수 갱신의 추정 오차를 제어한다.

실험 결과

연구 질문

  • RQ1일반합 마르코프 게임에서 플레이어당 행동 수에 다항적 의존도를 가지는 표본 복잡도로 균형의 수렴성에 대해 Coarse Correlated Equilibrium (CCE)를 학습할 수 있는가?
  • RQ2다수 플레이어 게임에서 Correlated Equilibrium (CE) 학습의 표본 복잡도가 나시 균형 학습보다 더 우수한가?
  • RQ3게임의 구조적 가정(예: 마르코프 퍼텐셜 게임)이 나시 균형 학습의 표본 복잡도를 크게 향상시킬 수 있는가?
  • RQ4기존의 1/ε⁶ 기준을 초월하여 나시 균형 학습의 ε-의존도를 개선할 수 있는가?

주요 결과

  • CCE-V-학습 알고리즘은 ε-근사 CCE를 Õ(H⁵S maxᵢAᵢ / ε²)의 표본 복잡도로 달성하며, 이는 maxᵢAᵢ에 대해 다항적 의존도를 가진다.
  • CE-V-학습 알고리즘은 Õ(H⁶S maxᵢAᵢ² / ε²)의 에피소드 수로 ε-근사 CE를 학습하며, 행동 수에 다항적 의존도를 가지는 첫 번째 결과이다.
  • 마르코프 퍼텐셜 게임의 경우, 나시-CA 알고리즘은 Õ(S ∑ᵢAᵢ / ε³)의 에피소드 수로 ε-근사 나시 균형을 학습하며, 이는 이전 연구의 1/ε⁶ 의존도에 비해 향상된 결과이다.
  • CE를 위한 알고리즘은 예측 가능한 가중치를 갖는 가중치 스왑 불만을 최소화하는 새로운 적대적 밴딧 서브루틴을 통합한다.
  • 예측 가능한 가중치를 갖는 적대적 밴딧에서 가중치 불만 및 가중치 스왑 불만에 대한 새로운 분석 결과를 도입하였으며, 별도의 관심사로도 유의미하다.
  • 논문은 잠재 함수 게임과 같은 구조적 가정이 다수 플레이어가 존재하는 상황에서도 표본 복잡도를 극적으로 감소시킬 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.