Skip to main content
QUICK REVIEW

[论文解读] Schedule Earth Observation satellites with Deep Reinforcement Learning

Adrien Hadj-Salah, Rémi Verdier|arXiv (Cornell University)|Nov 12, 2019
Optimization and Search Problems参考文献 11被引用 10
一句话总结

本文提出一种基于A2C的深度强化学习(DRL)方法,用于调度大范围区域的地球观测卫星任务,通过优化云量较少的图像获取时间,相较于人工设计的启发式方法表现更优。该方法学习长期策略,与最先进启发式方法相比,可将任务完成时间减少最多10%。

ABSTRACT

Optical Earth observation satellites acquire images worldwide , covering up to several million square kilometers every day. The complexity of scheduling acquisitions for such systems increases exponentially when considering the interoperabil-ity of several satellite constellations together with the uncertainties from weather forecasts. In order to deliver valid images to customers as fast as possible, it is crucial to acquire cloud-free images. Depending on weather forecasts, up to 50% of images acquired by operational satellites can be trashed due to excessive cloud covers, showing there is room for improvement. We propose an acquisition scheduling approach based on Deep Reinforcement Learning and experiment on a simplified environment. We find that it challenges classical methods relying on human-expert heuristic.

研究动机与目标

  • 为解决在国家或大陆等大范围区域中调度无云地球观测卫星任务的挑战。
  • 通过减少对在天气不确定性下表现次优的人工专家启发式方法的依赖,降低任务完成时间。
  • 评估深度强化学习是否能够学习到优于经典启发式方法的稳健、长期调度策略。
  • 证明在存在天气预报不确定性等动态不确定环境下的卫星星座调度中,使用DRL的可行性。
  • 通过使用真实天气数据的仿真进行验证,并与随机基线和启发式基线进行对比。

提出的方法

  • 将问题形式化为马尔可夫决策过程(MDP),其中智能体在每次卫星过境时选择获取哪个网格。
  • 构建了一个简化的仿真环境,包含4颗相同的卫星,每颗卫星的幅宽为60公里,覆盖法国本土作为感兴趣区域(共122个网格)。
  • 观测空间包括短期(1次过境)和长期(20次过境)的云量预报及实际观测数据,并使用线性函数建模预报偏差。
  • DRL智能体采用优势演员-评论家(A2C)算法,采用卷积神经网络架构处理空间网格观测数据,并输出动作概率。
  • 奖励函数设计用于惩罚过长的任务持续时间,并鼓励获取低云量覆盖的网格,重点在于最小化总完成时间。
  • 训练使用2013–2014年天气数据,测试使用2015年数据,通过训练-测试划分评估泛化能力。

实验结果

研究问题

  • RQ1与启发式方法相比,深度强化学习能否学习到减少大范围地球观测请求任务完成时间的调度策略?
  • RQ2将长期天气预报纳入观测空间是否能提升调度性能?
  • RQ3当在历史数据上训练时,DRL智能体在未见天气条件下的泛化能力如何?
  • RQ4DRL智能体在任务完成时间方面是否能优于随机选择和专家设计的启发式方法?
  • RQ5观测时域(1次与20次过境)对DRL智能体性能有何影响?

主要发现

  • 采用20次过境长期观测时域的A2C-20智能体,其平均回合长度为278.5,显著优于启发式智能体的平均值292.7。
  • 在约80%的测试案例中,A2C-20智能体的完成时间短于启发式方法,表明其具备更优的泛化能力与策略学习能力。
  • A2C-1智能体(1次过境视图)的表现与启发式方法相当,平均回合长度为299.3,表明仅依赖短期规划不足以实现最优性能。
  • 所有DRL智能体在未见的2015年天气数据上均表现出良好泛化能力,标准差较低(55.8–58.2),显示出对天气变化的鲁棒性。
  • 结果证实,基于预报云量信息的长期战略规划,对于在大范围地球观测调度中最小化任务持续时间至关重要。
  • 本研究证明,DRL可在复杂、不确定的调度任务中超越人工设计的启发式方法,为工业级部署铺平道路。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。