Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient play in stochastic games: stationary points, convergence, and sample complexity

Runyu Zhang, Zhaolin Ren|arXiv (Cornell University)|2021. 06. 01.
Reinforcement Learning in Robotics참고 문헌 45인용 수 4
한 줄 요약

이 논문은 직접 매개변수화된 정책을 가진 스토하스틱 게임에서 일阶 정류점과 내쉬 균형(Nash equilibria, NEs) 간의 등가성을 확립하며, 그로 인해 강한 내쉬 균형으로의 그래디언트 플레이의 국소 수렴을 증명하고, 마르코프 잠재력 게임(Markov potential games)에 대해 비점근적(global) 수렴 속도를 제공한다. 또한 샘플 기반의 분산형 강화학습 알고리즘을 설계하여 $\widetilde{O}\left(\frac{n}{\epsilon^{6}}\textup{poly}\left(\frac{1}{1-\gamma},|\mathcal{S}|,\max_{i}||\mathcal{A}_{i}||\right)\right)$의 샘플 복잡도를 갖는다. 이는 $\epsilon$-NE에 도달할 수 있다.

ABSTRACT

We study the performance of the gradient play algorithm for stochastic games (SGs), where each agent tries to maximize its own total discounted reward by making decisions independently based on current state information which is shared between agents. Policies are directly parameterized by the probability of choosing a certain action at a given state. We show that Nash equilibria (NEs) and first-order stationary policies are equivalent in this setting, and give a local convergence rate around strict NEs. Further, for a subclass of SGs called Markov potential games (which includes the setting with identical rewards as an important special case), we design a sample-based reinforcement learning algorithm and give a non-asymptotic global convergence rate analysis for both exact gradient play and our sample-based learning algorithm. Our result shows that the number of iterations to reach an $ε$-NE scales linearly, instead of exponentially, with the number of agents. Local geometry and local stability are also considered, where we prove that strict NEs are local maxima of the total potential function and fully-mixed NEs are saddle points.

연구 동기 및 목표

  • 직접 매개변수화된 정책을 가진 스토하스틱 게임에서 일阶 정류점과 내쉬 균형(Nash equilibria, NEs) 간의 관계를 이해하기 위해.
  • 강한 내쉬 균형 주변에서 그래디언트 플레이의 국소 수렴 행동을 분석하고 안정성을 특성화하기 위해.
  • 마르코프 잠재력 게임(Markov potential games)에 대해 전역 수렴 보장을 갖는 샘플 효율적이고 완전히 분산형 강화학습 알고리즘을 설계하기 위해.
  • 유한한 상태-행동 공간을 가진 스토하스틱 게임에서 $\epsilon$-내쉬 균형을 학습하는 데 필요한 샘플 복잡도를 정량화하기 위해.

제안 방법

  • 일반화된 그래디언트 지배 성질(gradient domination property)을 단일 에이전트에서 다중 에이전트 스토하스틱 게임으로 확장하여, 일阶 정류 정책과 내쉬 균형 간의 등가성을 확립한다.
  • 국소 기하학과 안정성 분석을 사용하여 강한 내쉬 균형 주변에서 그래디언트 플레이의 국소 수렴을 분석한다.
  • 동일한 보상 설정을 포함하는 스토하스틱 게임의 하위클래스인 마르코프 잠재력 게임(Markov potential games, MPGs)의 개념을 도입하고, 그래디언트 플레이 하에서 내쉬 균형으로의 전역 수렴을 증명한다.
  • 다른 에이전트의 정책가 고정되어 있을 때 각 에이전트의 평균화된 MDP(마르코프 결정 과정)를 활용하는 샘플 기반, 완전히 분산형 강화학습 알고리즘을 제안한다.
  • 에이전트의 평균화된 MDP에 기반한 모델 기반 정책 평가를 사용하여 샘플에서 기울기를 추정한다.
  • 비점근적 분석을 활용하여 샘플 복잡도의 상한을 유도하고, 이는 에이전트 수에 따라 선형으로 증가함을 보였다.

실험 결과

연구 질문

  • RQ1직접 매개변수화된 정책을 가진 스토하스틱 게임에서 그래디언트 플레이 알고리즘의 일阶 정류점은 내쉬 균형과 등가인가?
  • RQ2강한 내쉬 균형 주변에서 그래디언트 플레이의 국소 안정성과 수렴 행동은 어떠한가?
  • RQ3마르코프 잠재력 게임에서 그래디언트 플레이가 내쉬 균형으로의 전역 수렴을 보장할 수 있는가?
  • RQ4분산형, 샘플 기반 알고리즘을 사용할 때 스토하스틱 게임에서 $\epsilon$-내쉬 균형을 학습하는 데 필요한 샘플 복잡도는 얼마인가?
  • RQ5에이전트 수가 학습 알고리즘의 수렴 속도와 샘플 효율성에 어떤 영향을 미치는가?

주요 결과

  • 직접 매개변수화된 정책을 가진 스토하스틱 게임에서 일阶 정류 정책은 내쉬 균형과 등가이며, 최적화와 게임 이론적 균형 간의 기본적인 연결 고리를 확립한다.
  • 그래디언트 플레이는 유한한 단계 내에 강한 내쉬 균형으로 국소 수렴하며, 이 설정에서 국소 수렴 속도가 확립된다.
  • 강한 내쉬 균형은 총 잠재력 함수의 국소 최대값이며, 이는 그래디언트 플레이 동역학 하에서의 안정성을 시사한다.
  • 완전히 혼합된 내쉬 균형은 그래디언트 플레이 하에서 안장점(saddle points)이 되며, 이는 불안정성과 이러한 점으로부터의 발산 가능성을 암시한다.
  • 제안된 샘플 기반 강화학습 알고리즘은 $\epsilon$-내쉬 균형을 높은 확률로 달성하며, $\widetilde{O}\left(\frac{n}{\epsilon^{6}}\textup{poly}\left(\frac{1}{1-\gamma},|\mathcal{S}|,\max_{i}|\mathcal{A}_{i}|\right)\right)$의 샘플을 사용한다.
  • 샘플 복잡도는 에이전트 수 $n$에 따라 선형으로 증가하므로, 이전 결과의 지수적 증가와 비교해도 유리한 확장성을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.