Skip to main content
QUICK REVIEW

[논문 리뷰] Solving Discounted Stochastic Two-Player Games with Near-Optimal Time and Sample Complexity

Aaron Sidford, Mengdi Wang|arXiv (Cornell University)|2019. 08. 29.
Reinforcement Learning in Robotics참고 문헌 38인용 수 17
한 줄 요약

이 논문은 할인율이 적용된 스토케스틱 두 명의 플레이어가 참여하는 제로섬 게임을 near-optimal 샘플 및 시간 복잡도로 해결하는 새로운 알고리즘을 제시한다. 이는 $\tilde{O}((1-\gamma)^{-3}\epsilon^{-2})$개의 샘플을 요구하며, 마르코프 결정 과정(MDP)에서 알려진 최고의 복잡도 경계와 일치한다. 단조성 유지 업데이트와 분산 감소 기법을 통해 Q-러닝을 일반화함으로써, 샘플 수에 대해 거의 선형적인 런타임과 스페이스를 사용하면서도 $\varepsilon$-최적 전략으로의 고확률 수렴을 보장한다.

ABSTRACT

In this paper, we settle the sampling complexity of solving discounted two-player turn-based zero-sum stochastic games up to polylogarithmic factors. Given a stochastic game with discount factor $γ\in(0,1)$ we provide an algorithm that computes an $ε$-optimal strategy with high-probability given $ ilde{O}((1 - γ)^{-3} ε^{-2})$ samples from the transition function for each state-action-pair. Our algorithm runs in time nearly linear in the number of samples and uses space nearly linear in the number of state-action pairs. As stochastic games generalize Markov decision processes (MDPs) our runtime and sample complexities are optimal due to Azar et al (2013). We achieve our results by showing how to generalize a near-optimal Q-learning based algorithms for MDP, in particular Sidford et al (2018), to two-player strategy computation algorithms. This overcomes limitations of standard Q-learning and strategy iteration or alternating minimization based approaches and we hope will pave the way for future reinforcement learning results by facilitating the extension of MDP results to multi-agent settings with little loss.

연구 동기 및 목표

  • 강화학습에서 마르코프 결정 과정(MDP)과 스토케스틱 게임을 해결할 때의 샘플 복잡도 간 격차를 해소하기 위해.
  • MDP 해법에서의 최적 샘플 복잡도를 최대 다항로그 인자 수준까지 유지하면서 두 명의 플레이어가 참여하는 스토케스틱 게임을 해결하는 알고리즘을 개발하기 위해.
  • 단일 에이전트 MDP에서 near-optimal Q-러닝 알고리즘의 일반화를 다중 에이전트 환경으로 확장하고, 증명 가능하고 효율적인 수렴성을 확보하기 위해.
  • 표준 Q-러닝과 전략 반복 기법의 한계를 극복하기 위해 양방향 단조성 제약 조건을 강제 적용함으로써 두 명의 플레이어가 참여하는 게임에서의 성능을 향상시키기 위해.
  • MDP 기반 강화학습 결과를 다중 에이전트 환경에 적용할 수 있도록 하되, 최소한의 오버헤드로 가능하게 하기 위해.

제안 방법

  • 알고리즘은 값 반복과 전략 업데이트를 포함하는 Q-러닝의 변종을 사용하며, 주의 깊은 초기화와 오차 제어를 통해 값과 전략 수열의 단조성을 유지한다.
  • 이중 단계 샘플링 프로세스를 도입한다: 초기에 큰 배치를 사용해 값과 분산을 추정하고, 이후에 더 작은 배치를 사용해 한쪽 오차 경계를 갖는 값 추정치를 정밀화한다.
  • 핵심 구성 요소로는 값이 $[0, (1-\gamma)^{-1}]$ 범위 내에 유지되도록 보장하는 클리핑된 Q-함수 업데이트를 사용한다. 이는 안정성과 단조성 유지에 기여한다.
  • 값 추정치의 한쪽 오차를 보장하기 위해 편향 보정 항 $\alpha_1^{3/4}\beta$ 과 신뢰도 기반 조정 $C(1-\gamma)u$ 를 적용한다.
  • 현재 값 추정치와 일致하는 전략을 유지함으로써 단조 증가 값-전략 수열(MIVSS)을 유지한다. 이는 $\boldsymbol{v}^{-(i)} \geq \boldsymbol{v}^{-(i-1)}$ 와 $\pi^{-(i)}$ 의 일致성을 강제한다.
  • 알고리즘은 샘플 수에 대해 거의 선형적인 시간과 공간 복잡도를 가지며, 거의 최적의 샘플 복잡도를 달성한다.

실험 결과

연구 질문

  • RQ1할인율이 적용된 스토케스틱 게임을 near-optimal 샘플 복잡도로 해결할 수 있는가? MDP에서 알려진 최고의 경계와 일치하는가?
  • RQ2Q-러닝 기반 방법은 두 명의 플레이어가 참여하는 스토케스틱 게임으로 일반화될 수 있는가? 수렴성과 단조성은 유지되는가?
  • RQ3전략 반복 과정에서 스토케스틱 게임을 해결하기 위해 필요한 MDP 해법의 수를 줄일 수 있는가? $\Omega(1/(1-\gamma))$ 장벽을 피할 수 있는가?
  • RQ4두 명의 플레이어가 참여하는 게임에서 샘플 불확실성 하에 값과 전략 수열의 이중 단조성을 유지할 수 있는가?
  • RQ5MDP 알고리즘의 이론적 보장 사항은 다중 에이전트 환경으로 확장될 수 있는가? 샘플 또는 시간 복잡도의 손실 최소화로 가능할까?

주요 결과

  • 알고리즘은 고확률로 $\varepsilon$-최적 전략을 계산하기 위해 $\tilde{O}((1-\gamma)^{-3}\epsilon^{-2})$개의 샘플을 요구한다.
  • 런타임은 샘플 수에 대해 거의 선형이며, 스페이스 사용량은 상태-행동 쌍 수에 대해 거의 선형이다.
  • 이 방법은 아자르 등(2013)이 밝힌 MDP의 최적 샘플 복잡도를 다항로그 인자 수준까지 일치시킨다.
  • 알고리즘은 시드포드 등(2018a)이 제안한 near-optimal Q-러닝 프레임워크를 두 명의 플레이어가 참여하는 스토케스틱 게임으로 성공적으로 일반화한다.
  • 양방향 단조성 강제와 분산 인지 샘플링을 통해 표준 전략 반복 또는 교차 최소화 방법의 비효율성을 피한다.
  • 이론적 분석을 통해 MDP와 스토케스틱 게임 간의 샘플링 복잡도 격차는 극복될 수 있으며, 정확한 해법 시간의 계산적 난이도 격차가 있음에도 불구하고 가능하다는 것이 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.