Skip to main content
QUICK REVIEW

[논문 리뷰] Pure and Stationary Optimal Strategies in Perfect-Information Stochastic Games with Global Preferences

Hugo Gimbert, Wiesław Zielonka|arXiv (Cornell University)|2016. 11. 25.
Game Theory and Applications참고 문헌 3인용 수 4
한 줄 요약

이 논문은 전역 선호도를 가진 이인제 완전 정보 스토케스틱 게임에서 최적의 결정적 정적 전략의 존재를 입증하기 위해 문제를 일인용 마르코프 결정 과정(MDP)으로 환원함으로써 이를 성립시킨다. 핵심 기여는 모든 파생된 일인용 게임에서 최적의 결정적 정적 전략이 존재할 경우, 그에 상응하는 이인용 게임에서도 최적의 결정적 정적 전략이 존재한다는 일반적인 환원을 보여주는 것이다. 이는 보상 구조나 플레이에 대한 선호 순서에 관계없이 성립한다.

ABSTRACT

We examine the problem of the existence of optimal deterministic stationary strategiesintwo-players antagonistic (zero-sum) perfect information stochastic games with finitely many states and actions.We show that the existenceof such strategies follows from the existence of optimal deterministic stationarystrategies for some derived one-player games.Thus we reducethe problem from two-player to one-player games (Markov decisionproblems), where usually it is much easier to tackle.The reduction is very general, it holds not only for all possible payoff mappings but alsoin more a general situations whereplayers' preferences are not expressed by payoffs.

연구 동기 및 목표

  • 이인제 완전 정보 스토케스틱 게임에서 최적의 결정적 정적 전략이 존재할 조건을 규명하는 것.
  • 표준 보상 함수로 표현할 수 없는 전역 선호도의 문제를 다루는 것.
  • 이인용 게임의 복잡성을 일인용 마르코프 결정 과정(MDP)으로 환원하여 최적 전략 분석을 용이하게 하는 것.
  • 평균 보상, 할인 보상, 파리티 게임과 같은 기존 게임에서 최적 전략에 대한 결과를 일반화하는 것.
  • 표준 보상 함수뿐 아니라 추상적인 플레이에 대한 선호 순서에도 적용 가능한 통합 프레임워크를 제공하는 것.

제안 방법

  • 저자는 원래 게임의 구조에서 유도된 일인용 게임(MDP)으로의 환원을 정의한다.
  • 일반화된 게임에서 원래 게임으로 전략을 확장하기 위해, 다수의 행동을 가진 분리 상태를 사용하는 리프팅 구조를 도입한다.
  • 게임 클래스의 특정 변환에 대한 닫힘 성질에 기반하여, 일인용 게임에서 최적 전략이 존재하면 이에 상응하는 이인용 게임에서도 최적 전략이 존재함을 보장한다.
  • 핵심 기술적 도구로는 한 명의 플레이어가 제어하는 분리 상태 ω를 사용하며, 이 상태의 행동을 통해 파생된 게임의 전략을 원래 게임으로 리프팅한다.
  • 증명은 귀납법을 사용하고, 최적 전략을 리프팅을 통해 구성함으로써 결정성과 정적 전략 성질을 유지한다.
  • 이 방법은 수치적 보상 외의 모든 보상 함수와 플레이에 대한 선호 순서에 적용 가능하다.

실험 결과

연구 질문

  • RQ1전역 선호도를 가진 이인제 완전 정보 스토케스틱 게임에서 최적의 결정적 정적 전략이 존재하는 조건은 무엇인가?
  • RQ2이인용 게임에서 최적의 결정적 정적 전략이 존재하는 것이 일인용 게임에서의 존재성으로 환원될 수 있는가?
  • RQ3이 환원 방법은 수치적 보상 외의 구조, 예를 들어 플레이에 대한 확률 측도에 대한 선호 순서에도 적용 가능한가?
  • RQ4예를 들어 결정론적 아레나, 사이클이 없는 게임과 같은 일반적인 게임 클래스에서는 이 환원이 더 강력한 존재 결과를 도출하는가?
  • RQ5이 프레임워크는 파리티 게임과 평균 보상 게임을 동시에 포함하는 다목적 게임으로 확장 가능한가?

주요 결과

  • 최적의 결정적 정적 전략이 존재하는 것은 이인제 완전 정보 스토케스틱 게임에서 유도된 모든 일인용 게임에서 최적의 결정적 정적 전략이 존재할 조건과 동치이다.
  • 이인용 게임에서 일인용 게임으로의 환원 과정은 최적 전략의 결정성과 정적 성질을 유지한다.
  • 이 결과는 모든 보상 함수와 플레이에 대한 선호 순서에 대해 성립하며, 수치적 보상 외의 경우에도 적용 가능하다.
  • 이 방법은 결정론적 아레나를 가진 게임과 자기 순환 외의 사이클이 없는 게임에 대해서도 적용 가능하다.
  • 증명 과정에서 명시적인 전략을 리프팅을 통해 구성함으로써, 기억 요구량이 유한하고 관리 가능하다는 것을 보여준다.
  • 이 프레임워크는 기존의 평균 보상, 할인 보상, 파리티 게임에 대한 결과를 일반화하여, 이들의 존재 증명을 통합한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.