QUICK REVIEW
[论文解读] Mean Field Games with Ergodic cost for Discrete Time Markov Processes
Anup Biswas|arXiv (Cornell University)|Oct 30, 2015
Markov Chains and Monte Carlo Methods参考文献 6被引用 19
一句话总结
该论文在一般σ-紧波兰空间上,针对具有遍历代价的离散时间受控马尔可夫过程,建立了平均场博弈(MFG)均衡的存在性。通过Kakutani-Fan-Glicksberg不动点定理,以及基于极小化条件和分裂链构造所得的值函数等度连续性,证明了在凸性和稳定性假设下,有限N人博弈的纳什均衡在N → ∞时收敛于MFG解。
ABSTRACT
We consider mean field games with ergodic cost in the framework of a general discrete time controlled Markov processes. The state space of the processes is given by a general $σ$-compact Polish space. Under certain conditions, we show the existence of a mean field game equilibrium. We also study the $N$-person game where the players interacts with each other via their empirical measure. We show that the $N$-person game has Nash equilibrium and as $N$ tends to infinity the equilibria converge to a mean field game solution.
研究动机与目标
- 为在σ-紧波兰空间上的离散时间马尔可夫过程中具有遍历代价的平均场博弈(MFG)建立一个通用框架。
- 在包括几何稳定性与极小化条件在内的广义条件下,建立MFG均衡的存在性。
- 证明通过经验测度相互作用的有限N人博弈中纳什均衡的存在性。
- 在凸性假设下,证明N人博弈的纳什均衡在N → ∞时收敛于MFG解。
- 通过不动点理论与遍历控制技术,弥合有限人博弈与平均场极限之间的鸿沟。
提出的方法
- 应用Kakutani-Fan-Glicksberg不动点定理,通过证明最优响应对应关系的上半连续性,来证明MFG均衡的存在性。
- 利用极小化条件并构造分裂链,以建立遍历控制问题中值函数的等度连续性。
- 施加一个几何稳定性条件(2.2),以确保所有平稳受控过程均存在不变测度。
- 采用折扣值函数逼近方法,令α → 1,以分析遍历控制问题并推导出极限平均代价。
- 通过在小球上的 hitting time 论证,以有界期望代价并导出值函数的统一估计。
- 应用控制收敛定理与马尔可夫过程的遍历性质,以证明经验测度与代价平均值的收敛性。
实验结果
研究问题
- RQ1在一般状态空间上,离散时间受控马尔可夫过程具有遍历代价时,平均场博弈均衡在何种条件下存在?
- RQ2当玩家通过其经验分布相互作用时,如何建立有限N人博弈中纳什均衡的存在性?
- RQ3在何种条件下,N人博弈的纳什均衡会收敛于平均场博弈解(当N → ∞)?
- RQ4在缺乏扩散或Harnack型不等式的情况下,如何建立值函数的等度连续性?
- RQ5MFG解能否被表征为由最优控制与不变测度条件导出的集值映射的不动点?
主要发现
- 在满足温和正则性与稳定性条件的前提下,离散时间受控马尔可夫过程在σ-compact波兰空间上存在平均场博弈均衡。
- 通过极小化条件与分裂链构造,证明了遍历控制问题的值函数具有等度连续性,从而使得不动点定理得以应用。
- 通过Kakutani-Fan-Glicksberg不动点定理,证明了通过经验测度相互作用的有限N人博弈中纳什均衡的存在性。
- 在凸性假设(A7)下,N人博弈的纳什均衡在N → ∞时弱收敛于平均场博弈解。
- 极限MFG解满足一个包含最优控制与不变测度的不动点方程,其长期平均代价等于遍历代价。
- MFG解中的最优控制满足一个涉及平均代价与值函数的动态规划方程,且在不变测度下几乎必然成立。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。