Skip to main content
QUICK REVIEW

[논문 리뷰] On the computational complexity of solving stochastic mean-payoff games

Vladimir Gurvich, Peter Bro Miltersen|ArXiv.org|2008. 12. 02.
Logic, Reasoning, and Knowledge참고 문헌 10인용 수 3
한 줄 요약

이 논문은 Condon 게임(간단한 스토케스틱 게임), 유니터리(reward/확률 표현을 사용한) 스토케스틱 평균지급 게임, 그리고 이와 동일한 게임이 이진 표현을 사용할 때의 다항시간 동치성을 확립한다. 저자들은 이러한 세 유형의 게임을 풀이하는 데 필요한 계산 복잡도가 동일하다는 것을 증명하며, 보상 추가 및 이진 인코딩 사용이 표준 간단한 스토케스틱 게임의 문제 난이도를 초월해 복잡도를 증가시키지 않음을 시사한다.

ABSTRACT

We consider some well-known families of two-player, zero-sum, perfect information games that can be viewed as special cases of Shapley's stochastic games. We show that the following tasks are polynomial time equivalent: - Solving simple stochastic games. - Solving stochastic mean-payoff games with rewards and probabilities given in unary. - Solving stochastic mean-payoff games with rewards and probabilities given in binary.

연구 동기 및 목표

  • 스토케스틱 평균지급 게임(할인되지 않은 Gillette 게임)을 풀이하는 것이 단순 스토케스틱 게임(Condon 게임)을 풀이하는 것과 계산적으로 동치인지 판단하는 것.
  • 게임 플레이 중 보상이 포함될 경우, 스토케스틱 게임을 풀이하는 데 있어 계산 복잡도가 단순 스토케스틱 게임의 복잡도를 초월하는지 조사하는 것.
  • 입력 표현 방식—특히 보상과 확률의 유니터리 대비 이진 인코딩—이 이러한 게임을 풀이하는 데 있어 복잡도에 미치는 영향을 검토하는 것.
  • Filar 게임과 같이 한 플레이어에 의존하는 전이를 가진 Gillette 게임의 더 일반화된 형태가 Condon 게임과 다항시간 동치로 남는지 탐구하는 것.

제안 방법

  • 할인된 Gillette 게임에서 Condon 게임으로의 감소를 위해 보조 정점과 확률적 기능을 도입하여 할인을 종료 상태 흡수 확률을 통해 시뮬레이션하는 방법.
  • 기존 게임의 모든 보상을 [0,1] 구간으로 애핀 스케일링하여 전략의 동치성을 유지하면서 최적 행동을 변경하지 않음.
  • 기존 게임의 각 (상태, 행동) 쌍에 대해 Condon 게임에서 새로운 랜덤 정점을 생성하며, 행동의 보상과 전이 확률에 따라 플레이를 라우팅하고, 할인된 보상 비례로 종료 상태로의 흡수 확률을 설정함.
  • 전략적 동치성을 입증하기 위해, Condon 게임에서 종료 상태에 도달할 확률이 원래 Gillette 게임의 할인된 기대 보상과 동일하다는 것을 보임.
  • Condon 게임에서 할인되지 않은 Gillette 게임으로의 역감소를 구축하기 위해 종료 상태 흡수를 보상 1로 매핑하고, 나머지 모든 전이를 보상 0으로 설정함으로써 종료 상태에 도달할 확률을 한계 평균 지급으로 유지함.
  • 원래 게임의 순수 및 위치 전략이 변환된 게임의 전략과 일대일로 대응되며, 양방향 감소에서 최적 전략이 유지됨을 증명함.

실험 결과

연구 질문

  • RQ1Condon 게임을 풀이하는 것과 스토케스틱 평균지급 게임(할인되지 않은 Gillette 게임)을 풀이하는 것이 계산적으로 동치인가?
  • RQ2스토케스틱 게임에서 플레이 중 보상이 포함될 경우, 단순 스토케스틱 게임의 복잡도를 초월해 계산 복잡도가 증가하는가?
  • RQ3스토케스틱 평균지급 게임을 풀이하는 데 있어 계산 복잡도가 입력 표현 방식(유니터리 대비 이진 인코딩)에 따라 달라지는가?
  • RQ4Filar 게임과 같이 한 플레이어에 의존하는 전이를 가진 Gillette 게임의 더 일반화된 형태가 다항시간 내에 Condon 게임으로 감소 가능한가?

주요 결과

  • Condon 게임을 풀이하는 것은 보상과 확률이 유니터리로 표현된 스토케스틱 평균지급 게임을 풀이하는 것과 다항시간 동치이다.
  • 보상과 확률이 이진으로 표현된 스토케스틱 평균지급 게임을 풀이하는 것 역시 Condon 게임을 풀이하는 것과 다항시간 동치이다.
  • 게임 플레이 중 보상의 존재는 스토케스틱 게임을 풀이하는 데 있어 복잡도를 단순 스토케스틱 게임의 복잡도를 초월해 증가시키지 않는다.
  • 할인된 Gillette 게임에서 Condon 게임으로의 감소는 최적 전략을 유지하며 다항시간 내로 계산 가능하며, Condon 게임에서의 흡수 확률은 원래 게임의 할인된 보상과 동일하다.
  • Condon 게임에서 할인되지 않은 Gillette 게임으로의 역감소는 종료 상태에 도달할 확률을 한계 평균 지급으로 유지하여 전략적 동치성을 보장한다.
  • 결과적으로, 이러한 게임 가족을 풀이하는 데 있어 계산 복잡도는 보상 포함 여부 또는 입력의 유니터리/이진 인코딩 방식과 관계없이 근본적으로 동일하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.