Skip to main content
QUICK REVIEW

[논문 리뷰] Policy iteration algorithm for zero-sum multichain stochastic games with mean payoff and perfect information

Marianne Akian, Jean Cochet-Terrasson|arXiv (Cornell University)|2012. 08. 02.
Supply Chain and Inventory Management참고 문헌 2인용 수 9
한 줄 요약

이 논문은 평균 수익과 완전 정보를 가진 0-합 다사슬 마르코프 게임에 대해 비선형 스펙트럴 투영을 사용하여 발산을 방지하고 수렴을 보장하는 정책 반복 알고리즘을 제시한다. 이 방법은 렉시코그래픽 단조성에 의해 종료 보장을 하며, 리치먼 게임과 추적-도피 게임을 포함한 대규모 사례를 성공적으로 해결하며 평균 수익과 상대적 가치 벡터를 검증한다.

ABSTRACT

We consider zero-sum stochastic games with finite state and action spaces, perfect information, mean payoff criteria, without any irreducibility assumption on the Markov chains associated to strategies (multichain games). The value of such a game can be characterized by a system of nonlinear equations, involving the mean payoff vector and an auxiliary vector (relative value or bias). We develop here a policy iteration algorithm for zero-sum stochastic games with mean payoff, following an idea of two of the authors (Cochet-Terrasson and Gaubert, C. R. Math. Acad. Sci. Paris, 2006). The algorithm relies on a notion of nonlinear spectral projection (Akian and Gaubert, Nonlinear Analysis TMA, 2003), which is analogous to the notion of reduction of super-harmonic functions in linear potential theory. To avoid cycling, at each degenerate iteration (in which the mean payoff vector is not improved), the new relative value is obtained by reducing the earlier one. We show that the sequence of values and relative values satisfies a lexicographical monotonicity property, which implies that the algorithm does terminate. We illustrate the algorithm by a mean-payoff version of Richman games (stochastic tug-of-war or discrete infinity Laplacian type equation), in which degenerate iterations are frequent. We report numerical experiments on large scale instances, arising from the latter games, as well as from monotone discretizations of a mean-payoff pursuit-evasion deterministic differential game.

연구 동기 및 목표

  • 마르코프 체인에 대해 비가역성 가정을 하지 않는 0-합 다사슬 마르코프 게임에 대해 평균 수익과 완전 정보를 가진 정책 반복 알고리즘을 개발한다.
  • 평균 수익 벡터가 향상되지 않는 열악한 반복이 발생하는 상황에서도 알고리즘의 수렴을 보장한다.
  • 평균 수익 벡터와 상대적 가치 벡터(편향)를 포함하는 비선형 방정식계를 통해 게임의 가치를 특성화한다.
  • 리치먼 게임과 추적-도피 미분 게임의 단조적 이산화와 같은 실용적 문제에 알고리즘을 적용한다.
  • 대규모 수치 사례에서 알고리즘의 효율성과 안정성을 입증한다.

제안 방법

  • 열악한 반복 동안 상대적 가치 벡터를 갱신하기 위해 선형 잠재력 이론에서의 초호모틱 함수 감소와 유사한 비선형 스펙트럴 투영을 사용한다.
  • 각 반복 단계에서 현재 전략의 평균 수익과 상대적 가치를 계산하며, 평균 수익이 향상되지 않을 경우 감소 단계를 통해 상대적 가치를 갱신한다.
  • 평균 수익과 상대적 가치 벡터의 수열은 렉시코그래픽 단조성 성질을 만족하여 순환을 방지하고 유한한 종료를 보장한다.
  • 동적 프ogramming 연산자는 다각형이며 순서 유지 및 덧셈 동차성을 가지며, 이는 가치에 대한 불변 반선 특성화를 가능하게 한다.
  • 알고리즘은 두 플레이어의 전략을 번갈아 최적화하는 이중 플레이어 정책 반복 루프로 구현된다.
  • 수치 실험에서는 연속적인 추적-도피 게임을 유한 차분 이산화하여 수행하며, 상태 공간은 격자에 따라 이산화되고 동작은 경계 위반을 방지하기 위해 제한된다.

실험 결과

연구 질문

  • RQ10-합 다사슬 마르코프 게임에 대해 평균 수익을 가진 정책 반복 알고리즘을 설계할 수 있는가? 특히 빈번한 열악한 반복이 발생하더라도 순환을 방지할 수 있는가?
  • RQ2비가역성 가정이 없을 경우 비선형 스펙트럴 투영 개념을 어떻게 적응시켜 수렴을 보장할 수 있는가?
  • RQ3다사슬 게임에서 평균 수익을 특성화하는 데 상대적 가치 벡터는 어떤 역할을 하는가?
  • RQ4이 알고리즘은 추적-도피 게임의 이산화된 사례나 리치먼 게임과 같은 대규모 사례에서 어떻게 성능을 발휘하는가?
  • RQ5비대칭 속도를 가진 게임, 예를 들어 쥐와 고양이 게임에서 상대적 가치 벡터와 최적 전략 간의 관계는 무엇인가?

주요 결과

  • 비록 열악한 반복이 발생하더라도 렉시코그래픽 단조성 성질 덕분에 값과 상대적 가치 수열의 수렴이 보장되어 알고리즘이 유한 시간 내에 종료된다.
  • 고양이 속도가 0.999인 쥐와 고양이 게임에서, 캐처 볼 외부의 위치 x에 대해 평균 수익은 η(x) = 0.492이며, 내부에서는 η(x) = 0이다. 이는 쥐가 거리를 유지할 수 있음을 시사한다.
  • 고양이 속도가 1.001일 경우 평균 수익은 거의 0에 수렴하며, 고양이가 결국 쥐를 잡는다는 것을 의미한다. 상대적 가치 벡터는 도착 시간의 구조를 보여준다.
  • 같은 속도일 경우(bar{b} = 1), 상대적 가치가 약 0이며 평균 수익은 η(x) ≈ ||x||²₂로 나타나 거리가 일정하게 유지됨을 의미한다.
  • 257×257 격자로 구성된 대규모 사례를 성공적으로 해결하였으며 잔차는 1e-14 이하, CPU 시간은 1000초 이내를 기록하였다.
  • 강한 열악한 반복은 bar{b} = 0.999 및 bar{b} = 1.001인 경우에만 최종 단계에서 발생하여 수렴 안정성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.