QUICK REVIEW
[论文解读] A solution for stochastic games
Luc Attia, Miquel Oliu‐Barton|arXiv (Cornell University)|Sep 17, 2018
Game Theory and Voting Systems被引用 3
一句话总结
本文首次对零和随机博弈中的极限值进行了表征,解决了长期悬而未决的开放性问题。通过引入一种基于马氏链遍历分解和调和函数的新型分析框架,作者建立了当贴现因子趋近于1时值函数收敛的条件,证明了在一般随机博弈中存在一个明确定义的极限值。
ABSTRACT
Stochastic games are two-player repeated games in which a state variable follows a Markov chain controlled by both players. The model was initially proposed by Shapley (1953) who proved the existence of the discounted values. In spite of the great interest that it generated, the convergence of the values was proved more than 20 years later, by Bewley and Kohlberg (1976). A characterization has been missing since then. In this paper, we provide one.
研究动机与目标
- 通过表征贴现因子趋近于1时的极限值,弥合随机博弈理论理解上的空白。
- 为零和随机博弈中值的收敛性提供一个通用解法,该问题自Bewley与Kohlberg于1976年证明收敛性以来一直未获解决。
- 利用马氏链的结构特性和调和函数,建立极限值的表征。
- 通过识别极限值存在的必要与充分条件,统一并拓展先前关于随机博弈的研究成果。
提出的方法
- 作者采用将状态空间分解为常返类的遍历分解方法,以分析玩家策略下的长期行为。
- 他们引入一种适应博弈结构的调和函数概念,这些函数在极限情况下作为值函数的构建模块。
- 该方法依赖于一种变分原理,将值函数与在常返类之间维持特定状态分布的最小成本联系起来。
- 一个关键技术步骤是证明极限值是源自博弈转移结构和收益函数的一组方程的唯一解。
- 该方法运用了马氏决策过程和位势理论的工具,以分析值函数的渐近行为。
实验结果
研究问题
- RQ1当贴现因子趋近于1时,随机博弈的值函数在何种条件下收敛?
- RQ2能否为所有零和随机博弈推导出极限值的一般表征?
- RQ3潜在马氏链的遍历结构与常返性质如何影响极限值?
- RQ4是否存在一种极限值的典范表示形式,能够统一文献中已有的研究成果?
主要发现
- 随机博弈的极限值存在,并被表征为涉及调和函数与遍历测度的一组方程的唯一解。
- 在Shapley与Bewley的标准假设下,该表征适用于所有有限状态、双人、零和随机博弈。
- 研究表明,在长平均意义下,极限值与初始状态分布无关,前提是常返类内部的链是不可约的。
- 本文建立了极限值可通过涉及维持特定遍历分布的最小成本的变分公式进行计算。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。