Skip to main content
QUICK REVIEW

[논문 리뷰] Existence of the uniform value in repeated games with a more informed controller

Fabien Gensbittel, Miquel Oliu‐Barton|arXiv (Cornell University)|2013. 01. 09.
Game Theory and Applications참고 문헌 8인용 수 8
한 줄 요약

이 논문은 한 명의 플레이어(플레이어 1)가 상태에 대해 더 많은 정보를 갖고 있으며, 다른 플레이어의 믿음의 진화를 통제하는 0-합 반복 게임에서 균일 가치의 존재를 확립한다. 두 번째 플레이어의 믿음에 대한 플레이어 1의 믿음인 이차 믿음 공간 위에 보조 스토케스틱 게임을 구성하고, 레누아의 동적 프로그래밍에 기반한 존재 결과를 활용함으로써, 저자들은 원래 게임에서 이 보조 게임의 최적 전략을 실현할 수 있음을 증명한다. 이는 불완전 감시 조건 하에서도 균일 가치의 존재를 일반적인 조건에서 보장한다.

ABSTRACT

We prove that in a general zero-sum repeated game where the first player is more informed than the second player and controls the evolution of information on the state, the uniform value exists. This result extends previous results on Markov decision processes with partial observation (Rosenberg, Solan, Vieille 2002), and repeated games with an informed controller (Renault 2012). Our formal definition of a more informed player is more general than the inclusion of signals, allowing therefore for imperfect monitoring of actions. We construct an auxiliary stochastic game whose state space is the set of second order beliefs of player 2 (beliefs about beliefs of player 1 on the true state variable of the initial game) with perfect monitoring and we prove it has a value by using a result of Renault 2012. A key element in this work is to prove that player 1 can use strategies of the auxiliary game in the initial game in our general framework, which allows to deduce that the value of the auxiliary game is also the value of our initial repeated game by using classical arguments.

연구 동기 및 목표

  • 플레이어 1이 더 많은 정보를 갖고 있으며, 플레이어 2의 믿음의 진화를 통제하는 0-합 반복 게임에서 균일 가치의 존재를 확립하는 것.
  • 부분 관측 가능 마르코프 결정 과정과 더 많은 정보를 지닌 통제자가 있는 반복 게임에 대한 이전 결과를 일반화하는 것.
  • 행동의 관측이 불완전할 수 있는 상황에서도 적용 가능한 '더 많은 정보를 지닌다'는 개념의 보다 넓은 형식화를 시도하는 것.
  • 이차 믿음에 기반한 보조 게임의 전략이 원래 게임으로 이전될 수 있음을 증명하는 것.
  • 두 플레이어가 동일한 가치를 보장할 수 있음을 보여주어, 이는 균일 가치의 존재를 의미한다.

제안 방법

  • 상태 공간이 플레이어 2의 믿음에 대한 플레이어 1의 믿음인 이차 믿음 집합인 보조 스토케스틱 게임을 구성한다.
  • Renault의 동적 프로그래밍 결과를 활용하여 보조 게임가 균일 가치를 가짐을 증명한다.
  • 믿음 일관성과 전략 이전을 통해 플레이어 1이 보조 게임의 최적 전략을 원래 게임에서 실현할 수 있음을 보여준다.
  • 단계 수익에 대한 재귀적 추론을 활용하여, 플레이어 2가 블록 단위로 플레이함으로써 동일한 가치를 보장할 수 있음을 증명한다.
  • 고전적인 게임 이론적 추론을 통해 보조 게임의 가치와 원래 게임의 균일 가치를 동일시한다.
  • 가정 (A1)–(A3)를 적용하여, 플레이어 1이 플레이어 2의 전략을 알지 못해도 믿음을 계산할 수 있고, 믿음의 진화가 일관되게 이루어지도록 보장한다.

실험 결과

연구 질문

  • RQ1한 플레이어가 더 많은 정보를 갖고 있으며, 다른 플레이어의 믿음의 진화를 통제하는 반복 게임에서 균일 가치가 존재하는가?
  • RQ2부분 관측 가능 정보가 있는 반복 게임의 가치는 이차 믿음에 기반한 보조 게임의 가치에서 유도될 수 있는가?
  • RQ3완전한 관측이 이루어지는 보조 게임의 전략이 불완전 관측 조건이 적용되는 게임에 사용될 수 있는 조건은 무엇인가?
  • RQ4행동의 관측이 불완전한 경우에도 균일 가치의 존재를 이전 모델을 초월해 일반화할 수 있는가?
  • RQ5불완전 관측 조건 하에서 플레이어 2는 블록 플레이 전략을 통해 균일 가치를 동일하게 보장할 수 있는가?

주요 결과

  • 플레이어 1이 더 많은 정보를 갖고 있으며, 플레이어 2의 믿음의 진화를 통제하는 0-합 반복 게임에서, 불완전 감시 조건 하에서도 균일 가치가 존재한다.
  • 원래 게임의 가치는 플레이어 2의 이차 믿음 집합을 상태 공간으로 하는 보조 스토케스틱 게임의 가치와 같다.
  • 플레이어 1은 보조 게임의 최적 전략을 원래 게임에서 실현할 수 있어 가치의 달성 보장을 받는다.
  • 플레이어 2는 현재 단계와 믿음 상태에만 의존하는 재귀적 전략을 사용하여 블록 단위로 플레이함으로써 균일 가치를 보장할 수 있다.
  • 이전에 추측된 것보다 더 약한 조건 하에서도 균일 가치의 존재가 보장되며, 행동의 관측이 불완전한 경우에도 적용 가능하다.
  • 이 결과는 이전에 알려진 부분 관측 가능 마르코프 결정 과정과 완전히 정보가 있는 통제자가 있는 반복 게임의 결과를 일반화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.