Skip to main content
QUICK REVIEW

[论文解读] Deep 2FBSDEs For Systems With Control Multiplicative Noise

Marcus A. Pereira, Ziyi Wang|arXiv (Cornell University)|Jun 11, 2019
Stochastic processes and financial applications参考文献 39被引用 7
一句话总结

本文提出一种基于长短期记忆(LSTM)循环神经网络的深度学习算法,用于求解由完全非线性汉密尔顿-雅可比-贝尔曼(HJB)偏微分方程控制的随机最优控制问题,特别针对具有控制乘性噪声的系统。通过利用二阶前向-后向随机微分方程(2FBSDEs),该方法克服了传统方法中误差累积和可扩展性问题,在机器人和生物力学系统的仿真中表现出更优的性能与稳定性。

ABSTRACT

We present a deep recurrent neural network architecture to solve a class of stochastic optimal control problems described by fully nonlinear Hamilton Jacobi Bellmanpartial differential equations. Such PDEs arise when one considers stochastic dynamics characterized by uncertainties that are additive and control multiplicative. Stochastic models with the aforementioned characteristics have been used in computational neuroscience, biology, finance and aerospace systems and provide a more accurate representation of actuation than models with additive uncertainty. Previous literature has established the inadequacy of the linear HJB theory and instead rely on a non-linear Feynman-Kac lemma resulting in a second order forward-backward stochastic differential equations representation. However, the proposed solutions that use this representation suffer from compounding errors and computational complexity leading to lack of scalability. In this paper, we propose a deep learning based algorithm that leverages the second order Forward-Backward SDE representation and LSTM based recurrent neural networks to not only solve such Stochastic Optimal Control problems but also overcome the problems faced by previous approaches and scales well to high dimensional systems. The resulting control algorithm is tested on non-linear systems in robotics and biomechanics to demonstrate feasibility and out-performance against previous methods.

研究动机与目标

  • 解决现有线性化方法和基于采样的方法在求解高维随机最优控制问题(具有控制乘性噪声)时的局限性。
  • 克服现有基于FBSDE的求解器在求解非线性HJB PDE时的误差累积与计算复杂性问题。
  • 开发一种可扩展的深度学习框架,利用二阶FBSDE表示求解完全非线性HJB方程。
  • 在机器人学和生物力学的非线性系统中,证明该方法在可行性与性能上优于传统方法(如iLQG和标准FBSDE)。
  • 通过为循环网络设计新颖的初始化策略,实现高维系统的稳定训练。

提出的方法

  • 基于控制乘性噪声系统的非线性费曼-卡特定理,使用二阶前向-后向随机微分方程(2FBSDEs)表述随机最优控制问题。
  • 设计一种基于长短期记忆(LSTM)单元的深度循环神经网络架构,以逼近2FBSDE系统的解。
  • 采用基于后向SDE动态的损失函数,通过时间反向传播计算时间离散化梯度。
  • 实施两阶段训练策略:初期将网络权重初始化为零,以防止训练早期发散;随后采用自适应学习率进行微调。
  • 将训练后的网络用于通过从学习到的值函数和控制函数中采样前向SDE,生成控制策略。
  • 在低维系统(如CartPole)中使用Xavier初始化,但在高维系统(如四旋翼飞行器、人类手臂)中改用零初始化以稳定训练。

实验结果

研究问题

  • RQ1基于2FBSDE的深度学习方法能否有效求解具有控制乘性噪声的高维随机最优控制问题?
  • RQ2与标准FBSDE求解器相比,所提出的LSTM-based 2FBSDE框架是否能减少误差累积?
  • RQ3在非线性系统中,该方法是否能在控制轨迹上实现比iLQG和标准FBSDE更低的方差与更高的稳定性?
  • RQ4何种初始化策略能够实现高维随机控制问题中深度循环网络的稳定训练?
  • RQ5在仿真中,2FBSDE控制器在不同控制成本和噪声水平下表现如何?

主要发现

  • 在CartPole系统中,2FBSDE控制器在控制成本较低(R=0.1)时,控制轨迹的方差显著低于FBSDE和iLQG。
  • 在具有6条肌肉和控制乘性噪声的人类手臂仿真中,2FBSDE控制器成功抵达目标且轨迹方差低,而iLQG发散。
  • 在四旋翼飞行器系统中,2FBSDE在3秒时间窗内实现了稳定的悬停和轨迹跟踪,且方差低于FBSDE和iLQG。
  • 在高维系统(如人类手臂和四旋翼飞行器)中,零初始化对于训练深度循环网络至关重要,使原本在Xavier初始化下失败的训练得以收敛。
  • 该方法在多种非线性系统(包括机器人学和生物力学)中展现出良好的可扩展性与鲁棒性,在仿真中优于现有方法。
  • 人类手臂实验的相图显示,2FBSDE保持了小方差并成功抵达目标,而iLQG未能收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。