QUICK REVIEW
[论文解读] Time-Inconsistent Recursive Stochastic Optimal Control Problems
Qingmeng Wei, Jiongmin Yong|arXiv (Cornell University)|Jun 10, 2016
Stochastic processes and financial applications参考文献 7被引用 6
一句话总结
本文提出一种多人分层微分博弈方法,用于求解具有递归效用函数的时不一致递归随机最优控制问题。该文建立了均衡策略,并推导出相应的均衡Hamilton-Jacobi-Bellman(HJB)方程,在适当条件下证明了其适定性,从而为非马尔可夫性、时不一致的递归效用控制提供了严格的理论框架。
ABSTRACT
In this paper, we study a time-inconsistent stochastic optimal control problem with a recursive cost functional by a multi-person hierarchical differential game approach. An equilibrium strategy of this problem is constructed and a corresponding equilibrium Hamilton-Jacobi-Bellman (HJB, for short) equation is established to characterize the associated equilibrium value function. Moreover, a well-posedness result of the equilibrium HJB equation is established under certain conditions.
研究动机与目标
- 为解决由于递归效用导致传统时间一致性最优性失效的时不一致随机最优控制问题。
- 将决策过程建模为多人分层微分博弈,反映不同决策时刻之间的战略互动。
- 通过一种新型均衡HJB方程,刻画适用于递归成本结构的均衡策略与值函数。
- 在系数满足温和正则性与增长条件的前提下,建立均衡HJB方程的适定性。
- 将经典随机控制理论拓展至最优控制策略因递归效用偏好而缺乏时间一致性的场景。
提出的方法
- 在过滤概率空间上,使用带状态过程 $X(s)$、控制过程 $u(s)$ 和布朗运动 $W(s)$ 的受控Itô型SDE建模控制问题。
- 通过倒向随机微分方程(BSDE)引入递归成本泛函,其中价值过程 $Y_0(t)$ 表示具有指数贴现的期望贴现成本。
- 应用分层微分博弈框架以建模时不一致性,将每个决策时刻视为非合作博弈中的独立参与者。
- 通过刻画均衡策略为包含值函数 $V(t,x)$、控制 $u$ 与梯度 $V_x$ 的PDE系统,推导出均衡HJB方程。
- 利用均衡HJB方程的解,将均衡策略 $u^*(t,x)$ 定义为基于当前状态与时间的反馈控制。
- 通过不动点论证与Gronwall型估计,基于核界与系数的正则性假设,证明均衡HJB方程的适定性。
实验结果
研究问题
- RQ1当成本泛函依赖于未来结果的递归结构时,如何对时不一致的递归随机最优控制问题进行建模?
- RQ2在最优策略在某一时刻最优但未必在后续时刻仍最优的随机控制设定中,应采用何种适当的均衡概念?
- RQ3如何利用分层微分博弈框架,在递归效用存在的情况下推导出一致的均衡策略?
- RQ4何种条件可确保此类问题的均衡HJB方程存在唯一解?
- RQ5在标准正则性与增长条件下,能否严格推导出均衡HJB方程并证明其适定性?
主要发现
- 通过分层微分博弈方法构造了均衡策略,其中每个决策时刻作为非合作参与者,实现了在递归效用下的策略一致性。
- 均衡值函数满足一种新型HJB方程,该方程融合了均衡控制的反馈结构与成本的递归性质。
- 在系数满足Lipschitz连续性与线性增长等温和条件下,通过不动点论证证明了均衡HJB方程的适定性。
- 利用Gronwall不等式与涉及热核 $\Gamma(t,x;s,y)$ 的核估计,确保了解在扰动下的稳定性,从而确立了适定性。
- 均衡HJB方程的解给出了一个反馈控制律 $u^*(t,x)$,其在均衡意义下具有时间一致性,尽管问题本质上是时不一致的。
- 通过 $L^\infty$-型估计证明了近似解的收敛性,表明当近似参数 $\Pi$ 趋近于零时,近似解与真实解之间的差异趋于零。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。