Skip to main content
QUICK REVIEW

[논문 리뷰] Mean field limit of a continuous time finite state game

Diogo A. Gomes, Joana Mohr|arXiv (Cornell University)|2010. 11. 12.
Stochastic processes and financial applications참고 문헌 11인용 수 3
한 줄 요약

이 논문은 N+1명의 플레이어가 두 상태를 오가는 연속시간 유한상태 게임의 평균장 한계를 수립하며, N→∞일 때 N-플레이어 대칭 마르코프 완전 균형이 평균장 모델로 수렴함을 증명한다. 핵심 결과는 비용과 전이율에 대한 리프시츠 및 유계성 조건 하에서 평균장 역학과 종료비용 가치함수에 대한 결합된 미분방정식을 통해 도출된 가치함수와 전략에 대한 엄밀한 O(1/N) 수렴 속도이다.

ABSTRACT

Mean field games is a recent area of study introduced by Lions and Lasry in a series of seminal papers in 2006. Mean field games model situations of competition between large number of rational agents that play non-cooperative dynamic games under certain symmetry assumptions. They key step is to develop a mean field model, in a similar way that what is done in statistical physics in order to construct a mathematically tractable model. A main question that arises in the study of such mean field problems is the rigorous justification of the mean field models by a limiting procedure. In this paper we consider the mean field limit of two-state Markov decision problem as the number of players $N o \infty$. First we establish the existence and uniqueness of a symmetric partial information Markov perfect equilibrium. Then we derive a mean field model and characterize its main properties. This mean field limit is a system of coupled ordinary differential equations with initial-terminal data. Our main result is the convergence as $N o \infty$ of the $N$ player game to the mean field model and an estimate of the rate of convergence.

연구 동기 및 목표

  • 부분 정보를 가진 연속시간, 유한상태, 대칭 마르코프 결정 문제에서 평균장 근사의 엄밀한 정당성을 제시한다.
  • N+1명 플레이어 게임에 대해 대칭 부분 정보 마르코프 완전 균형의 존재성과 유일성을 확립한다.
  • 초기 조건과 종료 조건을 갖는 결합된 미분방정식 시스템으로서의 평균장 모델을 유도한다.
  • N→∞일 때 N-플레이어 게임이 평균장 모델로 수렴함을 증명하고, 명시적인 수렴 속도 추정을 제공한다.
  • 이전의 이산시간 결과를 연속시간으로 일반화하고, 정적 또는 비정적, 비에르고딕 설정으로 확장한다.

제안 방법

  • 대칭 및 부분 정보 전략을 갖는 연속시간 마르코프 결정 과정으로서 N+1명 플레이어 게임을 수립한다.
  • 해밀턴-자코비-벨리만 방정식에서 유도된 비선형 미분방정식 시스템을 통해 대칭 마르코프 완전 균형을 특성화한다.
  • 평균장 한계를 초기 조건이 있는 상태 분포 θ(t)에 대한 미분방정식과 종료 조건이 있는 가치함수에 대한 미분방정식으로 구성된 결합된 미분방정식 시스템으로 유도한다.
  • 다인의 공식과 리프시츠 추정을 적용하여 N-플레이어와 평균장 가치함수 및 전략 간의 차이를 제어한다.
  • 그론발름 유형 부등식을 사용하여 가치함수 및 전략 분포의 오차를 유 bounds 하여 O(1/N) 수렴 속도를 도출한다.
  • 가치함수 및 전이율의 차이에 대한 균일한 유 bounds 를 활용하여 시간에 따른 오차 전파를 제어한다.

실험 결과

연구 질문

  • RQ1부분 정보를 가진 연속시간, 유한상태 N-플레이어 게임에서 대칭 마르코프 완전 균형이 존재하고 유일하게 유지되는가?
  • RQ2N→∞일 때 평균장 한계가 엄밀히 유도될 수 있으며, 그 결과로 도출되는 미분방정식 시스템은 무엇인가?
  • RQ3N-플레이어 게임이 평균장 모델로 수렴하는 속도는 얼마이며, 정량적인 수렴 속도를 확립할 수 있는가?
  • RQ4비용 함수 및 전이 함수에 어떤 조건이 요구되어야 평균장 근사의 안정성과 수렴성이 보장되는가?
  • RQ5평균장 모델은 잘 정의되어 있으며, 동일한 조건 하에서 유일한 해를 갖는가?

주요 결과

  • N-플레이어 게임은 비선형 미분방정식 시스템으로 특성화된 유일한 대칭 부분 정보 마르코프 완전 균형을 갖는다.
  • 평균장 한계는 초기 데이터가 있는 상태 분포 θ(t)에 대한 미분방정식과 종료 데이터가 있는 가치함수에 대한 미분방정식으로 구성된 잘 정의된 초기-종료값 문제이다.
  • N→∞일 때 N-플레이어 게임의 가치함수 및 전략 분포가 평균장 모델의 가치함수 및 전략 분포로 O(1/N) 속도로 수렴한다.
  • 수렴 속도는 TC < 1 조건 하에서 확립되며, 여기서 T는 시간 영역이고 C는 비용 및 전이율의 리프시츠 상수에 따라 정의되는 상수이다.
  • 증명은 전이율 차이의 균일한 유 bounds 를 활용하여 N-플레이어와 평균장 가치함수 및 전략 간의 차이에 대해 그론발름 유형 추정을 적용하는 데 기반한다.
  • 오차 유 bounds 는 다인의 공식과 해밀토니안의 리프시츠 연속성에 의해 도출되며, 평균장 근사의 안정성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.