[论文解读] Deep neural networks algorithms for stochastic control problems on finite horizon: numerical applications
该论文提出了一种基于深度学习的算法——NNcontPI、Hybrid-Now、Hybrid-LaterQ 和 ClassifHybrid——通过性能迭代和混合迭代方法,利用神经网络近似值函数与最优策略,以解决高维有限-horizon 随机控制问题。与基于量化的方法(如 Qknn)相比,这些方法在高维场景下表现出具有竞争力或更优的性能,已在 100D PDE、期权对冲和微电网管理问题中得到实证验证。
This paper presents several numerical applications of deep learning-based algorithms that have been introduced in [HPBL18]. Numerical and comparative tests using TensorFlow illustrate the performance of our different algorithms, namely control learning by performance iteration (algorithms NNcontPI and ClassifPI), control learning by hybrid iteration (algorithms Hybrid-Now and Hybrid-LaterQ), on the 100-dimensional nonlinear PDEs examples from [EHJ17] and on quadratic backward stochastic differential equations as in [CR16]. We also performed tests on low-dimension control problems such as an option hedging problem in finance, as well as energy storage problems arising in the valuation of gas storage and in microgrid management. Numerical results and comparisons to quantization-type algorithms Qknn, as an efficient algorithm to numerically solve low-dimensional control problems, are also provided; and some corresponding codes are available on https://github.com/comeh/.
研究动机与目标
- 通过使用深度神经网络解决有限-horizon 随机控制问题中的维数灾难问题。
- 通过引入性能迭代和混合迭代算法,将演员-评论家强化学习方法扩展至有限-horizon 问题。
- 对高维和低维控制问题中的基于深度学习的算法提供数值验证。
- 在准确性和计算效率方面,将所提算法与成熟的基于量化的方法(Qknn)进行比较。
- 展示深度学习在解决复杂现实控制问题(如天然气储存和微电网管理)中的可行性与有效性。
提出的方法
- 使用深度神经网络(DNNs)分别以参数 θ 和 β 参数化控制策略和值函数。
- 采用性能迭代(PI)和混合迭代方案,通过蒙特卡洛回归迭代改进策略和值函数估计。
- 应用两种训练策略变体:仅利用(基于知识)和先探索后利用(使用初始控制估计的经验测度)。
- 实施一种混合方法(ClassifHybrid),结合分类与回归,以处理混合离散-连续控制空间,例如在微电网管理中的应用。
- 使用通过均匀分布或经验分布设计的训练测度 µn,在每个时间步采样状态以训练网络。
- 通过使用下一时间步的权重预训练值函数网络,以加速收敛并提高估计的时间稳定性。
实验结果
研究问题
- RQ1基于深度学习的算法是否能有效解决传统方法因维数灾难而失效的高维随机控制问题?
- RQ2在 100 维非线性 PDE 和二次倒向 SDE 上,性能迭代与混合迭代算法在准确性和计算成本方面如何比较?
- RQ3所提的深度学习方法在低维控制问题中,相较于基于量化的算法(如 Qknn)在多大程度上表现更优?
- RQ4训练分布的选择(仅利用 vs. 探索)对所学策略的收敛性和准确性有何影响?
- RQ5混合神经网络架构是否能比标准方法更有效地处理混合离散-连续控制空间(如微电网管理)?
主要发现
- 在 N=30 时,ClassifHybrid 在微电网问题中实现了 33.34(±0.31)的值函数估计,优于 Qknn 的 35.37(±0.34)。
- 在 N=200 时,Qknn 将值函数估计为 231.8(±1.2),表明其在长时域内具有稳定性能。
- Hybrid-Now 在微电网问题中优于 Qknn,尽管其耗时 7 分钟,而 Qknn 仅需不到一分钟。
- Qknn 所估计的最优决策表现出自然行为:当电池容量不足时开启发电机,当需求为负或电池已满时关闭发电机。
- ClassifHybrid 在微电网管理中成功处理了混合离散-连续控制空间,尽管复杂度较高,仍优于 Qknn。
- 通过使用下一时间步的权重预训练值函数网络,显著缩短了训练时间,并提高了估计的时间稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。