QUICK REVIEW
[论文解读] Deep neural network approximation for high-dimensional parabolic Hamilton-Jacobi-Bellman equations
Philipp Grohs, Lukas Herrmann|arXiv (Cornell University)|Mar 9, 2021
Model Reduction and Neural Networks被引用 4
一句话总结
该论文证明,在控制变量的动态为仿射且成本函数在控制变量上为二次型、控制值有界的条件下,深度神经网络(DNNs)可以避免维数灾难地逼近高维抛物型汉密尔顿-雅可比-贝尔曼(HJB)方程的解。关键结果是一个构造性证明,表明ReLU和ReCU DNN能够以在逆精度和维度上多项式增长的规模实现此类逼近,从而实现高维随机最优控制问题的高效数值求解。
ABSTRACT
The approximation of solutions to second order Hamilton--Jacobi--Bellman (HJB) equations by deep neural networks is investigated. It is shown that for HJB equations that arise in the context of the optimal control of certain Markov processes the solution can be approximated by deep neural networks without incurring the curse of dimension. The dynamics is assumed to depend affinely on the controls and the cost depends quadratically on the controls. The admissible controls take values in a bounded set.
研究动机与目标
- 解决随机最优控制中出现的高维抛物型HJB方程的维数灾难问题。
- 建立深度神经网络可在不引起维度指数级成本的情况下,对这类方程的值函数及其梯度实现逼近。
- 在控制问题的特定结构假设下,提供DNN逼近的构造性证明,其依赖于维度和精度的关系为多项式。
- 将现有的DNN逼近理论扩展至依赖梯度的非线性项的非线性PDE,这类PDE在HJB方程中具有核心地位。
- 通过证明近似误差界与维度无关,验证使用DNN求解实际高维最优控制问题的可行性。
提出的方法
- 作者结合Feynman-Kac公式对HJB解的概率表示与随机控制理论,将值函数表示为受控扩散过程上的期望。
- 采用光滑截断函数χ的局部化技术,将解限制在局部球内,从而可应用局部正则性估计。
- 证明依赖于抛物型PDE的Sobolev与Hölder正则性理论,表明局部化解及其导数在时空上为Hölder连续。
- 对PDE右侧应用光滑化过程,构造一系列光滑逼近,确保在Hölder范数下收敛。
- 通过正则性估计,建立光滑化解在$C^{1,2}$-Hölder空间中的收敛性,证明原解在每一点均继承$C^{1,2}$-正则性。
- 最终的DNN逼近构造基于ReLU和ReCU网络可多项式规模表示Hölder连续函数的事实。
实验结果
研究问题
- RQ1深度神经网络能否在不引发维数灾难的情况下逼近高维抛物型HJB方程的解?
- RQ2控制变量中仿射动态与二次成本的结构是否允许使用DNN实现与维度无关的逼近速率?
- RQ3HJB方程中依赖于值函数梯度的非线性项,能否被ReLU和ReCU深度神经网络有效捕捉?
- RQ4能否构建出网络规模在逆精度和维度上呈多项式增长而非指数增长的DNN,以解决此类HJB问题?
- RQ5能否利用值函数及其梯度的正则性,构建出具有可证明误差界的构造性DNN逼近方案?
主要发现
- 在给定假设下,HJB方程的值函数被证明在时空上具有$C^{1,2}$-正则性,从而可应用光滑逼近技术。
- 通过ReLU和ReCU激活函数的深度神经网络可逼近HJB方程的解,实现精度$\varepsilon$的逼近,且网络规模在$\varepsilon^{-1}$和维度$d$上呈多项式增长,避免了经典方法的指数成本。
- 该证明表明,逼近的指数尺度与空间维度$d$无关,从而克服了维数灾难。
- 该构造依赖于一系列具有光滑数据的光滑化PDE,其解在$C^{1,2}$-Hölder范数下收敛,确保了光滑极限的存在。
- 最终的DNN逼近通过组合与相加ReLU和ReCU网络构建,可控制规模地表示所需的Hölder连续函数。
- 结果确认,在仿射与二次结构假设下,深度学习方法在理论上对高维随机最优控制问题具有可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。