Skip to main content
QUICK REVIEW

[論文レビュー] Mean field limit of a continuous time finite state game

Diogo A. Gomes, Joana Mohr|arXiv (Cornell University)|Nov 12, 2010
Stochastic processes and financial applications参考文献 11被引用数 3
ひとこと要約

本稿は、N+1人で構成される連続時間かつ有限状態のゲームにおいて、2つの状態を往復するプレイヤーの平均場極限を確立し、N人対称マルコフ完璧均衡がN→∞のとき平均場モデルに収束することを証明する。主な結果は、コスト関数および遷移率にリプシッツ連続性と有界性の仮定をおくことで、価値関数および戦略の収束速度が厳密にO(1/N)であることを示したものであり、平均場ダイナミクスと終端コスト価値関数を記述する連立常微分方程式を用いて導出される。

ABSTRACT

Mean field games is a recent area of study introduced by Lions and Lasry in a series of seminal papers in 2006. Mean field games model situations of competition between large number of rational agents that play non-cooperative dynamic games under certain symmetry assumptions. They key step is to develop a mean field model, in a similar way that what is done in statistical physics in order to construct a mathematically tractable model. A main question that arises in the study of such mean field problems is the rigorous justification of the mean field models by a limiting procedure. In this paper we consider the mean field limit of two-state Markov decision problem as the number of players $N o \infty$. First we establish the existence and uniqueness of a symmetric partial information Markov perfect equilibrium. Then we derive a mean field model and characterize its main properties. This mean field limit is a system of coupled ordinary differential equations with initial-terminal data. Our main result is the convergence as $N o \infty$ of the $N$ player game to the mean field model and an estimate of the rate of convergence.

研究の動機と目的

  • 部分情報を持つ連続時間・有限状態・対称マルコフ意思決定ゲームにおける平均場近似を厳密に裏付けること。
  • N+1人ゲームにおける対称部分情報マルコフ完璧均衡の存在および一意性を確立すること。
  • 初期条件および終端条件を伴う連立常微分方程式系として平均場モデルを導出すること。
  • N→∞のときのN人ゲームから平均場モデルへの収束を証明し、明示的な収束速度を評価すること。
  • 離散時間の結果を連続時間へ一般化し、非定常的かつ非エルゴード的設定へ拡張すること。

提案手法

  • N+1人ゲームを、対称的かつ部分情報戦略を持つ連続時間マルコフ意思決定過程として定式化する。
  • ハミルトニアン・ジャコビ・ベルマン方程式から導かれる非線形常微分方程式系を用いて、対称マルコフ完璧均衡を特徴付ける。
  • 平均場極限を、初期条件を伴う状態分布θ(t)のための常微分方程式と、終端条件を伴う価値関数のための常微分方程式からなる連立系として導出する。
  • Dynkinの公式とリプシッツ推定を用いて、N人ゲームと平均場価値関数・戦略の差を制御する。
  • Gronwall型不等式を用いて、価値関数および戦略分布における誤差をバインドし、O(1/N)の収束速度を導出する。
  • 価値関数および遷移率の差に一様有界性を課すことにより、時間経過に伴う誤差の伝播を制御する。

実験結果

リサーチクエスチョン

  • RQ1部分情報を持つ連続時間・有限状態のN人ゲームにおいて、対称マルコフ完璧均衡は存在し、一意的であるか?
  • RQ2N→∞のとき、平均場極限を厳密に導出可能か?その結果得られる方程式系は何か?
  • RQ3N人ゲームは平均場モデルにどの程度の速さで収束するか?定量的な収束速度を確立できるか?
  • RQ4コスト関数および遷移関数にどのような条件を課すと、平均場近似の安定性および収束性が保証されるか?
  • RQ5平均場モデルは適切に定義されており、かつ、N人ゲームと同一の仮定のもとで一意解をもつか?

主な発見

  • N人ゲームは、非線形常微分方程式系によって特徴づけられる一意な対称部分情報マルコフ完璧均衡を有する。
  • 平均場極限は、初期データを伴う状態分布θ(t)のための常微分方程式と、終端データを伴う価値関数のための常微分方程式からなる、適切に定義された初期-終端値問題である。
  • N人ゲームの価値関数および戦略分布は、N→∞のとき、平均場モデルのそれらにO(1/N)の速度で収束する。
  • 収束速度は、T C < 1 であるという条件下で確立され、ここでTは時間区間、Cはコスト関数および遷移関数のリプシッツ定数に依存する定数である。
  • 証明は、N人ゲームと平均場価値関数・戦略の差にGronwall型推定を適用することに依拠しており、遷移率の差に一様有界性を課すことで実現される。
  • 誤差バインディングは、Dynkinの公式およびハミルトニアンのリプシッツ連続性を用いて導出され、平均場近似の安定性が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。