Skip to main content
QUICK REVIEW

[논문 리뷰] A tutorial on Zero-sum Stochastic Games

Jérôme Renault|arXiv (Cornell University)|2019. 05. 16.
Economic theories and models참고 문헌 20인용 수 5
한 줄 요약

이 가이드는 경쟁적 두 명의 플레이어 설정으로 확장된 마르코프 결정 과정의 동적 버전인 0-합 스토케스틱 게임에 대한 체계적인 수학적 소개를 제공한다. 이 글은 n-단계 및 λ-할인 게임에서의 값의 존재성과 수렴성에 대한 기본 결과를 수립하고, 통일된 값의 존재성을 증명하며, 연속적인 보상 및 전이 구조 하에서 n-단계와 λ-할인 값의 渐近적 행동이 동치임을 보여준다.

ABSTRACT

Zero-sum stochastic games generalize the notion of Markov Decision Processes (i.e. controlled Markov chains, or stochastic dynamic programming) to the 2-player competitive case : two players jointly control the evolution of a state variable, and have opposite interests. These notes constitute a short mathematical introduction to the theory of such games. Section 1 presents the basic model with finitely many states and actions. We give proofs of the standard results concerning : the existence and formulas for the values of the n-stage games, of the $λ$-discounted games, the convergence of these values when $λ$ goes to 0 (algebraic approach) and when n goes to +$\infty$, an important example called 'The Big Match' and the existence of the uniform value. Section 2 presents a short and subjective selection of related and more recent results : 1-player games (MDP) and the compact non expansive case, a simple compact continuous stochastic game with no asymptotic value, and the general equivalence between the uniform convergence of (v n) n and (v $λ$) $λ$. More references on the topic can be found for instance in the books by Mertens-Sorin

연구 동기 및 목표

  • 0-합 스토케스틱 게임에 대한 엄밀한 수학적 기초를 제공하여, 마르코프 결정 과정을 경쟁적 두 명의 플레이어 설정으로 일반화한다.
  • 유한한 상태 및 행동 공간 하에서 n-단계 및 λ-할인 게임의 값의 존재성과 공식을 수립한다.
  • n → ∞ 및 λ → 0일 때 값의 수렴성을 분석하여 일반적인 경우에서 통일된 값의 존재성을 증명한다.
  • 연속적인 스토케스틱 게임에서 n-단계 및 λ-할인 값 수열의 渐近적 행동 간의 동치성을 탐구한다.
  • 이론적 개념과 열린 문제를 설명하기 위해 The Big Match 및 흡수 게임과 같은 핵심 예시를 제시한다.

제안 방법

  • 유한한 상태 집합 K, 행동 집합 I 및 J, 보상 함수 g: K×I×J → ℝ, 전이 확률 q: K×I×J → Δ(K)를 사용하여 0-합 스토케스틱 게임의 기본 모델을 수식화한다.
  • 행동 전략, 마르코프 전략, 정적 전략을 정의하고, 무한한 플레이에 대한 확률 측도를 제품 σ-대부분을 사용하여 정의한다.
  • 혼합 행동에 대한 상한-하한 최적화를 통한 재귀적 특성화를 통해 Shapley 방정식을 적용하여 값 함수 v_n(k) 및 v_λ(k)를 기술한다.
  • 대수적 및 점근적 분석을 활용하여 n → ∞ 및 λ → 0일 때 v_n(k) 및 v_λ(k)의 극한 행동을 연구한다.
  • 콤���트성과 연속성 추론을 활용하여 연속적인 스토케스틱 게임에서 (v_n)과 (v_λ)의 통일된 수렴성 간의 동치성을 증명한다.
  • The Big Match 및 단일 플레이어 게임과 같은 특정 예시를 분석하여 비정상적인 수렴 행동과 일부 경우에서의 점근적 값의 부재를 설명한다.

실험 결과

연구 질문

  • RQ1n → ∞ 및 λ → 0일 때, n-단계 및 λ-할인 스토케스틱 게임의 값이 수렴하는 조건은 무엇인가?
  • RQ2연속적인 보상 및 전이 구조 하에서 v_n 및 v_λ의 수렴성에 기반해 0-합 스토케스틱 게임에서 통일된 값의 존재성이 도출되는가?
  • RQ3값이 수렴하지 않을 경우에도 일반적인 스토케스틱 게임에서 v_n 및 v_λ의 점근적 행동이 동치가 될 수 있는가?
  • RQ4일부 연속적인 스토케스틱 게임에서 점근적 값이 존재하지 않는 것이 갖는 의미는 무엇인가?
  • RQ5흡수 상태의 성질과 The Big Match와 같은 특정 게임 구조는 장기적 값 수렴에 어떻게 영향을 미치는가?

주요 결과

  • 모든 n과 λ ∈ (0,1)에 대해 n-단계 게임의 값 v_n(k) 및 λ-할인 게임의 값 v_λ(k)이 존재하며, 이는 Shapley 방정식을 만족한다.
  • n → ∞일 때, 값 v_n(k)은 주어진 가정 하에서 존재하고 잘 정의된 통일된 값으로 수렴한다.
  • λ → 0일 때, 값 v_λ(k)는 n → ∞일 때 v_n(k)가 수렴하는 것과 같은 극한으로 수렴하며, 이는 두 점근적 행동 간의 동치성을 증명한다.
  • 콤팩트한 거리 공간 상태 및 행동 공간과 연속적인 보상 및 전이 함수를 가진 연속적인 경우, (v_n)과 (v_λ)의 통일된 수렴성은 상호 동치이다.
  • The Big Match의 경우, λ → 0일 때 값 v_λ(k)는 수렴하지 않으며, 이는 일부 경우에서 점근적 값이 존재하지 않을 수 있음을 보여준다.
  • v_λ(k)의 극한은 1/2 이하로 유계이며, 특정한 λ_n 수열에 대해 y_λ 및 x_λ의 하한 및 상한이 각각 4/9 및 1/2임을 보여주며, 이는 그 경우에서 v_λ(k)의 수렴하지 않음을 증명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.