Skip to main content
QUICK REVIEW

[论文解读] Using Neural Networks to Compute Approximate and Guaranteed Feasible Hamilton-Jacobi-Bellman PDE Solutions

Frank J. Jiang, Glen Chou|arXiv (Cornell University)|Nov 10, 2016
Model Reduction and Neural Networks参考文献 31被引用 19
一句话总结

本文提出了一种基于神经网络的、无需网格的算法,用于近似最优控制中Hamilton-Jacobi-Bellman(HJB)PDE的值函数,无需状态空间离散化即可保证轨迹的保守性与可行性。通过训练神经网络生成严格满足系统约束的近似最优控制,该方法降低了计算复杂度,实现了长时域规划,同时保证了可行性与近似最优性,已在Dubins小车模型上得到验证,相较于传统水平集方法显著提升了速度。

ABSTRACT

To sidestep the curse of dimensionality when computing solutions to Hamilton-Jacobi-Bellman partial differential equations (HJB PDE), we propose an algorithm that leverages a neural network to approximate the value function. We show that our final approximation of the value function generates near optimal controls which are guaranteed to successfully drive the system to a target state. Our framework is not dependent on state space discretization, leading to a significant reduction in computation time and space complexity in comparison with dynamic programming-based approaches. Using this grid-free approach also enables us to plan over longer time horizons with relatively little additional computation overhead. Unlike many previous neural network HJB PDE approximating formulations, our approximation is strictly conservative and hence any trajectories we generate will be strictly feasible. For demonstration, we specialize our new general framework to the Dubins car model and discuss how the framework can be applied to other models with higher-dimensional state spaces.

研究动机与目标

  • 解决使用动态规划求解HJB PDE时面临的维数灾难问题。
  • 开发一种避免状态空间离散化同时保证轨迹可行性和近似最优性的方法。
  • 结合动态规划的优势(保守性)与机器学习的优势(可扩展性与效率)。
  • 实现在计算开销最小化情况下的长时域规划。
  • 提供一种对次优训练数据具有鲁棒性且可扩展至更高维系统的框架。

提出的方法

  • 训练神经网络在可行轨迹附近的局部区域近似值函数,避免对整个状态空间进行覆盖。
  • 该方法采用两阶段训练过程:首先通过探索生成多样化的轨迹,然后利用保守性过滤机制进行优化。
  • 锥形目标过滤器(R_O)用于剔除不可行或次优的状态,确保仅保留在ε范围内到达目标集的轨迹。
  • 长度过滤器用于移除过长的轨迹,提高对次优训练数据的鲁棒性,并提升训练集质量。
  • 值函数近似严格保守,意味着所有生成的轨迹均保证动力学可行性。
  • 该方法利用可达性分析进行验证,将基于神经网络的值函数与通过水平集方法计算的真值解进行比较。

实验结果

研究问题

  • RQ1基于神经网络的方法能否以保证所有生成轨迹可行的方式近似HJB值函数?
  • RQ2与传统动态规划和水平集方法相比,无网格、数据驱动的方法在多大程度上能降低计算复杂度?
  • RQ3该方法在不同初始条件和长时域规划任务上的泛化能力如何?
  • RQ4在保证值函数近似严格保守性的同时,能否维持近似最优性?
  • RQ5引入过滤机制(如长度和目标过滤器)在多大程度上提升了对噪声或次优训练数据的鲁棒性?

主要发现

  • 该方法在高端台式机上将计算时间减少了4天,仅用不到5分钟即在2012年款MacBook Pro上完成了相同任务。
  • 对于走廊计算,基于神经网络的值函数近似仅需179 MB存储空间,而低分辨率水平集方法则需7 GB。
  • 在Dubins小车模型中,神经网络生成的轨迹接近最优,其代价值接近真实最优代价:例如在状态(-12,5,2)处,代价为26.51 vs. 真实最优代价14.84。
  • 长度过滤器通过剔除由次优控制生成的状态,显著提升了训练集质量,如图5(a)与5(b)所示。
  • 锥形目标过滤器成功剔除了目标ε邻域外的状态,确保所有最终轨迹均处于可接受的可达范围内。
  • 该方法在多个初始状态下均表现出可行性与近似最优性,包括距离目标较远的状态,如(10,-4,-3),此时神经网络代价为16.20,真实代价为13.36。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。