[论文解读] On Zero-Sum Stochastic Differential Games
本论文通过使用覆盖论证而非离散逼近,建立了带无界平方可积控制的零和随机微分博弈的动态规划原理,并通过二阶双向反射倒向随机微分方程(DRBSDE)定义收益。关键贡献在于证明了值函数作为带障碍的完全非线性PDE的粘性解的存在性与唯一性,扩展了以往要求控制空间紧致的结果。
We generalize the results of Fleming and Souganidis (1989) on zero sum stochastic differential games to the case when the controls are unbounded. We do this by proving a dynamic programming principle using a covering argument instead of relying on a discrete approximation (which is used along with a comparison principle by Fleming and Souganidis). Also, in contrast with Fleming and Souganidis, we define our pay-off through a doubly reflected backward stochastic differential equation. The value function (in the degenerate case of a single controller) is closely related to the second order doubly reflected BSDEs.
研究动机与目标
- 将Fleming与Souganidis关于零和随机微分博弈的结果推广至无界控制的情形。
- 用覆盖论证替代先前工作中使用的离散逼近方法,以证明动态规划原理。
- 通过二阶双向反射BSDE定义博弈的收益,从而在无界控制约束下分析值函数。
- 将值函数确立为带障碍约束的完全非线性PDE的粘性解。
- 将随机微分博弈理论的适用范围扩展至更广泛、更现实的控制设定,超越紧致控制空间的限制。
提出的方法
- 使用覆盖论证证明动态规划原理,避免依赖早期工作中使用的离散逼近方案。
- 通过二阶双向反射倒向随机微分方程(DRBSDE)定义收益,该方程刻画了博弈的终端收益及约束条件。
- 应用平移过程与控制拼接技术,处理随机控制路径,确保在概率测度下的可测性与可积性。
- 利用条件概率分布与典型概率空间,从任意起始时间 t ∈ [0, T] 建模博弈动态。
- 运用粘性解理论,将值函数表征为带下界与上界反射屏障的完全非线性PDE的唯一解。
- 在测度变换下建立值函数与DRBSDE解之间的等价性,利用Girsanov定理与鞅表示定理。
实验结果
研究问题
- RQ1是否可以在不依赖离散逼近的前提下,为具有无界控制的零和随机微分博弈建立动态规划原理?
- RQ2当控制为平方可积且非紧支集时,此类博弈的收益应如何一致地定义?
- RQ3具有无界控制的零和博弈的值函数与二阶双向反射BSDE之间存在何种联系?
- RQ4在单一控制器的退化情形下,值函数是否为带障碍约束的完全非线性PDE的粘性解?
- RQ5平移过程与控制拼接在随机控制框架中如何保持可测性与可积性?
主要发现
- 通过覆盖论证而非离散逼近,证明了具有无界平方可积控制的零和随机微分博弈的动态规划原理成立。
- 证明值函数是带下界与上界反射屏障的完全非线性PDE的唯一粘性解,将经典结果推广至无界控制情形。
- 通过二阶双向反射BSDE严格定义了收益,该方程捕捉了博弈的终端收益与路径约束。
- DRBSDE的解与博弈的值函数等价,且该等价性在测度变换与时间平移下保持不变。
- 论文建立了值函数在控制拼接下保持稳定,这是随机控制中动态规划的关键性质。
- 分析确认值函数关于布朗运动与控制过程生成的自然滤子具有可测性与渐进可测性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。