Skip to main content
QUICK REVIEW

[论文解读] Real-time optimal control via Deep Neural Networks: study on landing problems

Carlos Sánchez‐Sánchez, Dario Izzo|arXiv (Cornell University)|Oct 27, 2016
Spacecraft Dynamics and Control被引用 7
一句话总结

本文提出使用深度神经网络(DNNs)来学习确定性、连续时间、非线性航空航天系统中精确行星着陆的实时最优控制策略。通过间接打靶法生成的最优状态-动作对进行监督学习训练,DNN在训练数据之外表现出良好的泛化能力,即使在质量变化和推力约束条件下,也能以极低的计算成本实现高精度的机载实时控制。

ABSTRACT

Recent research on deep learning, a set of machine learning techniques able to learn deep architectures, has shown how robotic perception and action greatly benefits from these techniques. In terms of spacecraft navigation and control system, this suggests that deep architectures may be considered now to drive all or part of the on-board decision making system. In this paper this claim is investigated in more detail training deep artificial neural networks to represent the optimal control action during a pinpoint landing, assuming perfect state information. It is found to be possible to train deep networks for this purpose and that the resulting landings, driven by the trained networks, are close to simulated optimal ones. These results allow for the design of an on-board real time optimal control system able to cope with large sets of possible initial states while still producing an optimal response.

研究动机与目标

  • 探究深度神经网络是否能有效近似连续时间、非线性、确定性航空航天系统中精确行星着陆的最优状态反馈控制策略。
  • 通过用轻量级训练好的DNN替代计算量大的最优控制求解器,实现实时机载控制。
  • 评估DNN对训练分布之外初始条件的泛化能力,确保在非正常场景下的鲁棒性。
  • 在多个航天器模型上,评估DNN驱动轨迹与模拟最优解相比的性能和最优性。
  • 探究DNN是否隐式学习系统动力学,从而实现在着陆后稳定悬停和长期目标保持。

提出的方法

  • 使用间接打靶法生成的最优状态-动作对,以监督方式训练深度前馈神经网络。
  • 以完整状态信息作为DNN输入,控制动作(如推力、俯仰角)作为输出,训练数据覆盖定义在区域 $\mathcal{A}$ 内的多样化初始条件。
  • 针对四种模型应用不同网络架构:四旋翼飞行器、推力受限的质量可变航天器、反作用轮控制的航天器,以及推力矢量控制的火箭。
  • 离线训练网络,使用最优轨迹数据集,随后在机载系统中部署,实现低计算开销的实时推理。
  • 通过在超出 $\mathcal{A}$ 的初始条件上测试,评估泛化能力,包括训练中未出现的向上推力需求情况。
  • 分析着陆后的长期行为,评估DNN是否学习到动态补偿机制(如质量损失导致的推力降低),以实现稳定悬停。

实验结果

研究问题

  • RQ1深度神经网络能否准确近似具有完整状态观测的连续时间、非线性、确定性航空航天系统的最优控制策略?
  • RQ2DNN在训练分布之外的初始条件上,特别是质量变化和姿态控制等复杂动力学下,其泛化能力达到何种程度?
  • RQ3DNN是否学习到底层的汉密尔顿-雅可比-贝尔曼(HJB)解结构,从而在训练区域之外实现稳定且最优的行为?
  • RQ4与浅层网络相比,网络深度如何影响所学控制策略的质量?
  • RQ5当航天器质量因推进剂消耗而减少时,DNN是否仍能维持稳定悬停,表明其隐式学习了系统动力学?

主要发现

  • DNN在所有四个测试模型(四旋翼飞行器、推力受限的质量可变航天器、反作用轮控制航天器、推力矢量控制火箭)上成功学习了最优控制策略,实现了高精度和接近最优的性能。
  • 对于四旋翼飞行器模型,DNN在训练区域 $\mathcal{A}$ 内达到100%成功率,最终代价函数最优性误差为1.82%,并在扩展区域 $\mathcal{A}_1$ 和 $\mathcal{A}_2$ 中保持高性能(成功率84.4%)。
  • 反作用轮航天器模型(RWSC-MOC)表现出强泛化能力,在 $\mathcal{A}_1$ 中成功率57.9%,在 $\mathcal{A}_2$ 中为34.9%,平均到目标距离分别为9.34 m和9.48 m,最优性误差分别为1.13%和0.86%。
  • 简单航天器模型(SSC-MOC)在 $\mathcal{A}_1$ 中成功率88.8%,在 $\mathcal{A}_2$ 中为57.8%,但平均到目标距离较大(分别为27.71 m和521.44 m),表明在扩展区域存在部分灾难性失败。
  • 显著的是,DNN驱动的轨迹在到达目标后表现出稳定悬停行为,推力随质量减少而自动降低——表明隐式学习到了系统动力学。
  • 网络深度至关重要:浅层网络无法捕捉最优控制策略的复杂结构,而深层架构显著提升了性能和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。