Skip to main content
QUICK REVIEW

[论文解读] A deep learning method for solving stochastic optimal control problems driven by fully-coupled FBSDEs

Shaolin Ji, Shigē Péng|arXiv (Cornell University)|Apr 12, 2022
Energy, Environment, and Transportation Policies被引用 4
一句话总结

本文提出了一种基于交叉优化(CO)框架的深度学习方法,用于求解由完全耦合的前向-后向随机微分方程(FBSDEs)驱动的高维随机最优控制问题。通过将问题重新表述为随机Stackelberg微分博弈,该方法交替使用深度神经网络优化领导者控制与跟随者状态变量,在具有递归效用模型的两个投资-消费示例中实现了高精度解。

ABSTRACT

In this paper,we mainly focus on the numerical solution of high-dimensional stochastic optimal control problem driven by fully-coupled forward-backward stochastic differential equations (FBSDEs in short) through deep learning. We first transform the problem into a stochastic Stackelberg differential game problem (leader-follower problem), then a bi-level optimization method is developed where the leader's cost functional and the follower's cost functional are optimized alternatively via deep neural networks. As for the numerical results, we compute two examples of the investment-consumption problem solved through stochastic recursive utility models, and the results of both examples demonstrate the effectiveness of our proposed algorithm.

研究动机与目标

  • 解决由完全耦合FBSDEs驱动的高维随机最优控制问题缺乏数值方法的问题。
  • 克服传统PDE或概率方法在求解高维FBSDEs时面临的计算困难。
  • 开发一种可扩展的深度学习框架,能够处理FBSDEs中前向与后向动态的耦合关系。
  • 将该方法应用于投资组合优化中的随机递归效用模型,验证其在金融应用中的有效性。

提出的方法

  • 将随机最优控制问题重新表述为随机Stackelberg微分博弈,其中领导者控制整个系统,而跟随者确定状态过程与伴随过程。
  • 构建三个前馈神经网络:一个用于近似领导者控制 $u(\cdot)$,另两个用于近似后向分量的初始值 $y_0$ 与扩散系数 $z(\cdot)$。
  • 定义两个代价泛函:$J(u(\cdot))$ 用于领导者优化,$J(y_0, z(\cdot))$ 用于跟随者最小化终端条件误差。
  • 实施一种交叉优化(CO)算法,交替更新神经网络参数:在领导者网络参数更新前,对跟随者网络执行 $\kappa \geq 1$ 步更新。
  • 使用蒙特卡洛采样估计代价泛函中的期望值,从而实现随机梯度下降训练。
  • 将该方法应用于具有递归效用的两个投资-消费问题,通过数值实验验证其性能。

实验结果

研究问题

  • RQ1深度学习能否有效求解由完全耦合FBSDEs驱动的高维随机最优控制问题?
  • RQ2所提出的基于Stackelberg的交叉优化方法在高维情形下与现有FBSDE数值格式相比表现如何?
  • RQ3跟随者更新次数 ($\kappa$) 对解的收敛性与稳定性有何影响?
  • RQ4该方法在递归效用模型中准确恢复初始值 $y_0$ 与控制 $u(\cdot)$ 的程度如何?
  • RQ5在投资-消费问题中,该方法在不同时间跨度与维度下的鲁棒性如何?

主要发现

  • 该方法成功求解了两个在递归效用下具有高维特征的投资-消费问题,在多个时间跨度下均实现了稳定且精确的结果。
  • 当 $T=1.00$ 且 $n=50$ 时,$y_0$ 的积分形式与参数形式之间的平均距离为 $0.00101 \pm 1.36 \times 10^{-7}$,表明具有极高的收敛精度。
  • 当 $\kappa=1$ 时,两种 $y_0$ 形式之间的距离为 $0.00124 \pm 1.58 \times 10^{-7}$,但当 $\kappa=1/49$ 时,该距离显著增加至 $0.06069 \pm 1.11 \times 10^{-7}$,表明 $\kappa>1$ 可提升稳定性。
  • 当 $\kappa=9$ 时,距离降至 $0.00043 \pm 2.08 \times 10^{-7}$,表明更多的跟随者更新可使两种解形式更好地对齐。
  • 在迭代过程中,$y_0$ 的参数形式与积分形式收敛非常接近,且在 $n=50$、$T=0.5$ 的情况下,平均值在训练5000步后趋于稳定。
  • 结果证实,CO方法有效且鲁棒,尤其当 $\kappa > 1$ 时表现更优,显著优于 $\kappa=1$ 的基线设置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。