Skip to main content
QUICK REVIEW

[论文解读] Autonomous Six-Degree-of-Freedom Spacecraft Docking Maneuvers via Reinforcement Learning

Charles Oestreich, Richard Linares|arXiv (Cornell University)|Aug 7, 2020
Space Satellite Systems and Control参考文献 23被引用 10
一句话总结

本文提出了一种基于强化学习的策略,用于在不确定环境中实现自主六自由度(6-DOF)航天器对接,采用近端策略优化(PPO)方法,实现了鲁棒且计算成本低的反馈控制。该方法在模拟的阿波罗轨道转换与对接场景中成功学习到对接策略,性能与最优控制方法相当,同时在处理不确定性与约束条件时表现出极低的次优性。

ABSTRACT

A policy for six-degree-of-freedom docking maneuvers is developed through reinforcement learning and implemented as a feedback control law. Reinforcement learning provides a potential framework for robust, autonomous maneuvers in uncertain environments with low on-board computational cost. Specifically, proximal policy optimization is used to produce a docking policy that is valid over a portion of the six-degree-of-freedom state-space while striving to minimize performance and control costs. Experiments using the simulated Apollo transposition and docking maneuver exhibit the policy's capabilities and provide a comparison with standard optimal control techniques. Furthermore, specific challenges and work-arounds, as well as a discussion on the benefits and disadvantages of reinforcement learning for docking policies, are discussed to facilitate future research. As such, this work will serve as a foundation for further investigation of learning-based control laws for spacecraft proximity operations in uncertain environments.

研究动机与目标

  • 开发一种在不确定环境中具有鲁棒性的自主6-DOF对接策略。
  • 解决传统最优控制在处理动态、不确定及复杂约束条件时的局限性。
  • 证明基于模型无关强化学习在近距离操作中实现低星上计算开销的可行性。
  • 使用GPOPS-II对比所学强化学习策略与标准最优控制方法的性能。
  • 识别并记录未来基于强化学习的航天器控制研究中的关键实现挑战与解决方案。

提出的方法

  • 使用近端策略优化(PPO)训练策略,将状态观测映射为控制动作,以最大化形状奖励函数。
  • 设计了丰富且受LQR启发的奖励函数,以确保在整个状态空间中实现平衡收敛,并引导轨迹持续时间。
  • 应用连续平滑的碰撞惩罚,且不终止智能体训练,以防止智能体学习违反安全约束的行为。
  • 将策略实现为实时反馈控制律,从而实现在飞行硬件上的低计算成本部署。
  • 动态调整KL散度裁剪和学习率等超参数,以稳定训练并保持策略更新的保真度。
  • 在高保真度的阿波罗轨道转换与对接机动仿真环境中评估该方法,包含相对平动与转动动力学。

实验结果

研究问题

  • RQ1强化学习能否生成一种稳定且可泛化的6-DOF对接策略,避免碰撞并最小化控制努力?
  • RQ2与传统最优控制方法相比,基于强化学习的策略在成本与收敛性方面表现如何?
  • RQ3在训练航天器对接的强化学习策略时,面临哪些关键挑战,又该如何缓解?
  • RQ4该强化学习策略能否以适合飞行系统的低星上计算成本实现?
  • RQ5奖励塑造在引导智能体实现期望轨迹形态与目标时间方面有多有效?

主要发现

  • 基于PPO的策略在模拟的阿波罗轨道转换与对接场景中成功实现了6-DOF对接,且未发生碰撞,展示了在状态空间子集上的鲁棒性。
  • 强化学习策略的性能达到GPOPS-II软件套件生成最优解的97.5%以内,表明次优性极低,损失可忽略。
  • 采用连续碰撞惩罚且不终止训练,防止了智能体学习违反安全约束的行为,这与某些先前的强化学习设置不同。
  • 动态调整KL散度裁剪和学习率稳定了训练过程,并在高方差探索阶段防止了策略崩溃。
  • 通过引入受LQR启发的奖励项实现奖励塑造,实现了状态空间中的一致收敛并改善了轨迹时间控制,尽管目标时间未被完全精确满足。
  • 该策略仅需中等计算资源,证实其在当前航天器飞控系统中实现实时部署的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。