[论文解读] Dynamic Set Values for Nonzero Sum Games with Multiple Equilibriums
本文引入了非零和随机微分博弈中具有多个纳什均衡的动态集合值,将其定义为所有均衡收益的集合。通过使用闭环、路径依赖的控制策略,建立了动态规划原理(DPP),并证明该集合值满足一个路径依赖的偏微分方程(PDE),从而实现数值计算,并保证了其正则性和稳定性。
Nonzero sum games typically have multiple Nash equilibriums (or no equilibrium), and unlike the zero sum case, they may have different values at different equilibriums. Instead of focusing on the existence of individual equilibriums, we study the set of values over all equilibriums, which we call the set value of the game. The set value is unique by nature and always exists (with possible value $\emptyset$). Similar to the standard value function in control literature, it enjoys many nice properties such as regularity, stability, and more importantly the dynamic programming principle. There are two main features in order to obtain the dynamic programming principle: (i) we must use closed-loop controls (instead of open-loop controls); (ii) we must allow for path dependent controls, even if the problem is in a state dependent (Markovian) setting. We shall consider both discrete and continuous time models with finite time horizon. For the latter we will also provide a duality approach through certain standard PDE (or path dependent PDE), which is quite efficient for numerically computing the set value of the game.
研究动机与目标
- 为解决非零和随机微分博弈中存在多个或无纳什均衡的问题,其中各个均衡可能产生不同的收益。
- 通过将所有均衡收益聚合为一个集合(称为集合值),定义一个唯一且行为良好的博弈值,该值始终存在(可能为空)。
- 为该集合值建立动态规划原理(DPP),确保在离散和连续时间模型中均具有时间一致性和正则性。
- 证明在开环控制或状态依赖控制下DPP不成立,即使在马尔可夫设定下也必须采用路径依赖的闭环策略。
- 通过路径依赖PDE的对偶方法,为连续时间模型中集合值的高效数值计算提供支持。
提出的方法
- 集合值被定义为所有纳什均衡收益的集合,通过构造确保其存在性和唯一性。
- 通过使用依赖于状态和时间的闭环控制(而非开环控制)建立动态规划原理。
- 即使在马尔可夫设定下,为使DPP成立,也必须采用路径依赖的控制,这是由于均衡值的非唯一性所致。
- 在连续时间中,集合值被表征为一个具有退化扩散和无界控制的路径依赖汉密尔顿-雅可比-贝尔曼(PPDE)方程的粘性解。
- 开发了一种对偶方法,利用路径依赖PDE(PPDE),在状态依赖情况下该PPDE退化为标准HJB方程。
- 该方法可通过求解PPDE实现集合值的数值计算,尤其在存在多个均衡时具有显著优势。
实验结果
研究问题
- RQ1当非零和随机微分博弈中存在多个纳什均衡时,能否定义一个唯一的博弈值?
- RQ2在非零和博弈中,集合均衡收益的动态规划原理在何种条件下成立?
- RQ3为何在非零和博弈中,必须使用闭环、路径依赖的控制策略才能使DPP成立,而控制问题或零和博弈中则不然?
- RQ4在存在多个均衡的连续时间模型中,如何对集合值进行数值计算?
- RQ5集合值与倒向随机微分方程(BSDEs)或路径依赖PDE之间的关系是什么?
主要发现
- 集合值始终是良好定义且唯一的,即使单个均衡不存在或产生不同的收益。
- 只有当使用闭环、路径依赖的控制时,集合值的动态规划原理才成立;若限制为开环控制或状态依赖控制,则DPP不成立。
- 集合值满足一个路径依赖的PDE(PPDE),该PPDE具有退化扩散和无界控制,并被表征为方程(3.57)的粘性解。
- 在马尔可夫(状态依赖)情形下,PPDE退化为标准HJB方程,如方程(3.57)(ii)所示。
- PPDE为集合值的高效数值计算提供了对偶方法,尤其适用于连续时间模型。
- 建立了与BSDE的联系:在适当条件下,所有均衡收益均可通过求解具有路径依赖系数的多维BSDE来构造。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。