[论文解读] Deep Reinforcement Learning for Autonomous Spacecraft Inspection using Illumination
本文提出一种基于深度强化学习(PPO)的控制器,用于自由飞行的伴飞航天器,以自主检查主航天器,同时最大化光学传感的光照条件。通过基于物理的光线追踪光照模型,该智能体在10组随机种子下实现了98.82%的四分位平均检查率,展示了在仿真中鲁棒、低推力、光照感知的自主检查能力。
This paper investigates the problem of on-orbit spacecraft inspection using a single free-flying deputy spacecraft, equipped with an optical sensor, whose controller is a neural network control system trained with Reinforcement Learning (RL). This work considers the illumination of the inspected spacecraft (chief) by the Sun in order to incentivize acquisition of well-illuminated optical data. The agent's performance is evaluated through statistically efficient metrics. Results demonstrate that the RL agent is able to inspect all points on the chief successfully, while maximizing illumination on inspected points in a simulated environment, using only low-level actions. Due to the stochastic nature of RL, 10 policies were trained using 10 random seeds to obtain a more holistic measure of agent performance. Over these 10 seeds, the interquartile mean (IQM) percentage of inspected points for the finalized model was 98.82%.
研究动机与目标
- 解决仅使用单个自由飞行的伴飞卫星实现主航天器自主、全面检查的挑战。
- 将真实的太阳光照建模整合到检查任务中,以确保高质量的光学数据采集。
- 使用深度强化学习开发样本高效、低层次的控制策略,以最大化覆盖范围和光照条件。
- 通过多个随机种子评估策略的鲁棒性,以确保在仿真环境中具有统计可靠性。
- 证明光照感知的强化学习可优于固定逻辑的光照策略,在自主检查任务中表现更优。
提出的方法
- 采用近端策略优化(PPO)作为深度强化学习算法,训练神经网络策略,以控制由Clohessy-Wiltshire方程描述的三自由度航天器动力学。
- 设计自定义的光照奖励信号,基于光线追踪,以在每个时间步计算主航天器表面的直接和间接太阳光照。
- 使用光谱光照模型(Blinn-Phong)模拟逼真的光照条件,包括表面反照率和光照的角依赖性。
- 将观测值定义为相对位置、速度和光照状态,动作则为三个主轴方向的推进器指令。
- 使用不同随机种子训练10个独立策略,以评估鲁棒性并计算四分位平均(IQM)性能指标。
- 在仿真环境中引入动态太阳旋转,以模拟随时间变化的光照条件。

实验结果
研究问题
- RQ1深度强化学习智能体能否仅通过低层次推进器指令,学习在最大化光照条件下检查主航天器的所有表面点?
- RQ2基于物理的光照模型的引入如何影响强化学习检查策略的性能和鲁棒性?
- RQ3在动态光照环境中,智能体在检查覆盖率和燃料效率(ΔV)之间达到多大程度的平衡?
- RQ4策略性能在多个随机种子下如何变化?所学行为的统计鲁棒性如何?
- RQ5智能体是否能通过适应自然轨道运动和太阳旋转,优化轨迹以最小化控制使用量,同时最大化光照覆盖的检查?
主要发现
- 该强化学习智能体成功检查了主航天器98.82%的表面点,基于100次试验和10组随机种子的四分位平均(IQM)测量结果。
- 该智能体在低ΔV消耗下实现了高性能检查,所有试验中平均ΔV为16.25 m/s,表明推进操作具有高燃料效率。
- 光谱光照模型(Blinn-Phong)的检查性能略低于简化模型,这符合预期,因为其光照阈值更严格。
- 尽管光谱模型复杂度更高,智能体仍保持了强劲性能,检查点的95%置信区间为[98.45, 99.13]%。
- 智能体表现出自适应行为,通过利用自然轨道运动和太阳旋转,稀疏使用推进器,并在光照条件改善时逐步检查新区域。
- 动画和可视化结果证实,智能体的轨迹系统性地探索了主航天器,同时随时间与最佳光照角度对齐。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。