[论文解读] Adaptive Guidance with Reinforcement Meta-Learning
本文提出了一种基于循环策略和价值函数的强化元学习框架,可在高度不确定、时变的动力学条件下实现航天器制导的实时自适应。该方法在四个具有挑战性的任务中均优于非循环策略和传统制导律,包括发动机故障和质量变化下的火星着陆,展现出无需事先掌握系统参数的鲁棒自适应能力。
This paper proposes a novel adaptive guidance system developed using reinforcement meta-learning with a recurrent policy and value function approximator. The use of recurrent network layers allows the deployed policy to adapt real time to environmental forces acting on the agent. We compare the performance of the DR/DV guidance law, an RL agent with a non-recurrent policy, and an RL agent with a recurrent policy in four difficult tasks with unknown but highly variable dynamics. These tasks include a safe Mars landing with random engine failure and a landing on an asteroid with unknown environmental dynamics. We also demonstrate the ability of a recurrent policy to navigate using only Doppler radar altimeter returns, thus integrating guidance and navigation.
研究动机与目标
- 开发一种能够对未知且高度可变的航天器动力学(如质量变化、执行器故障和环境不确定性)实现实时自适应的制导系统。
- 解决非循环强化学习策略在具有时变系统参数的部分可观察环境中的局限性。
- 证明循环网络可通过时间动态隐式学习未观测到的系统状态(如质量、受力),从而在无需显式状态估计的情况下实现鲁棒性能。
- 在多样且高保真的空间任务场景中验证该方法,包括小行星着陆和带有传感器噪声与系统故障的火星下降。
提出的方法
- 该方法在策略和价值函数中均采用带有循环神经网络层的近端策略优化(PPO),以保持捕捉时间依赖关系的隐藏状态。
- 在部署过程中,循环策略的隐藏状态根据观测和动作序列动态演化,从而实现实时自适应,应对未建模的动力学变化(如质量或推力效率的变化)。
- 智能体在广泛随机化系统参数(如发动机推力、质量、重力场)的分布上进行训练,以实现跨多种马尔可夫决策过程的元学习自适应策略。
- 观测仅包含部分状态信息(如多普勒雷达高度计返回值),要求循环网络从不完整测量中推断完整状态动力学。
- 循环架构使策略能够作为元学习的一种形式,快速适应部署过程中遇到的新动力学系统。
- 性能在四个任务中进行评估:未知动力学下的小行星着陆、带有噪声雷达的火星着陆、发动机故障以及下降过程中的高质心变化。
实验结果
研究问题
- RQ1在强化学习框架中,循环策略是否能有效适应实时部署期间未知且快速变化的航天器动力学?
- RQ2在处理如发动机故障或质量变化等系统不确定性时,循环策略与非循环(MLP)策略及传统DR/DV制导律相比表现如何?
- RQ3循环策略在仅能获取部分观测(如多普勒雷达返回值)的情况下,能在多大程度上推断未观测到的系统状态(如质量、外部受力)?
- RQ4通过随机化系统参数进行训练,是否能产生在多样化且复杂任务场景中具有良好泛化能力的鲁棒元学习策略?
- RQ5在如火星下降这类高风险场景中,若环境动力学未知,循环策略是否能实现安全且燃料高效的着陆?
主要发现
- 60步循环策略在发动机故障的火星着陆任务中实现了安全着陆,终端位置误差为0.3 m(μ),速度为1.00 m/s(μ),燃料消耗为295 kg(μ),显著优于DR/DV策略和MLP基线。
- 在高质心变化场景中,60步循环策略实现了0.6 m(μ)的终端位置误差、1.06 m/s(μ)的速度和1227 kg(μ)的燃料消耗,表明在大规模质量变化下仍能实现安全高效的下降。
- DR/DV策略在发动机故障和高质心变化任务中均发生灾难性失败,终端位置误差超过100 m,且终端速度超过20 m/s,存在安全隐患。
- 20步循环策略在发动机故障任务中表现最佳,终端速度为0.99 m/s(μ),下滑道角为49.99°,表明其下降过程稳定且精确。
- 循环策略能够实时适应未观测到的动力学变化(如质量和推力变化)的能力至关重要;相比之下,缺乏持续记忆的MLP策略在高不确定性下无法达到同等性能。
- 循环策略仅依靠多普勒雷达高度计返回值即成功完成导航,证明了其在无需完整状态反馈情况下的制导与导航一体化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。