[论文解读] Learning to Recharge: UAV Coverage Path Planning through Deep Reinforcement Learning
本文提出一种基于深度强化学习(DRL)的方法,采用近端策略优化(PPO)算法,结合基于地图的观测、动作掩码和折扣因子调度,解决具有充电需求的能耗受限无人机覆盖路径规划问题。该方法在性能上优于启发式基线模型,在多种地图(包括未见过的地图)上均表现出良好的泛化能力,并通过引入位置历史信息实现长时程决策,有效解决了状态循环问题。
Coverage path planning (CPP) is a critical problem in robotics, where the goal is to find an efficient path that covers every point in an area of interest. This work addresses the power-constrained CPP problem with recharge for battery-limited unmanned aerial vehicles (UAVs). In this problem, a notable challenge emerges from integrating recharge journeys into the overall coverage strategy, highlighting the intricate task of making strategic, long-term decisions. We propose a novel proximal policy optimization (PPO)-based deep reinforcement learning (DRL) approach with map-based observations, utilizing action masking and discount factor scheduling to optimize coverage trajectories over the entire mission horizon. We further provide the agent with a position history to handle emergent state loops caused by the recharge capability. Our approach outperforms a baseline heuristic, generalizes to different target zones and maps, with limited generalization to unseen maps. We offer valuable insights into DRL algorithm design for long-horizon problems and provide a publicly available software framework for the CPP problem.
研究动机与目标
- 解决因电池容量限制而需中途充电的能耗受限无人机覆盖路径规划挑战。
- 开发一种DRL框架,实现长任务周期内的全覆盖优化,同时集成充电停靠点。
- 通过基于模型的动作掩码和折扣因子调度,提升学习稳定性和安全性。
- 通过在多样化环境中训练并引入位置历史信息以解决状态循环问题,实现对未见过地图的泛化能力。
- 提供一个公开可用的、兼容OpenAI Gym的软件框架,以支持研究可复现性及未来在无人机CPP领域的研究。
提出的方法
- 将覆盖路径规划问题建模为马尔可夫决策过程(MDP),为DRL智能体提供全局和局部地图观测。
- 基于安全模型实施动作掩码,防止碰撞并强制执行可行动作,从而提升训练稳定性和安全性。
- 应用折扣因子调度,平衡即时奖励与长期奖励,使智能体在优化轨迹效率前先掌握任务求解能力。
- 引入智能体历史位置信息,以检测并解决因充电能力导致可返回已访问状态而引发的潜在状态循环问题。
- 在多样化地图上训练基于PPO的DRL智能体,包括专用智能体(在单一地图上训练)和多地图泛化智能体(如Multi10,训练于10张地图)。
- 采用基于模型的贪心启发式算法作为基线进行对比,评估指标包括完成任务的步数和任务解决率,覆盖多个地图。
实验结果
研究问题
- RQ1基于DRL的方法能否有效解决具有长时程、能耗受限且需充电的无人机覆盖路径规划问题?
- RQ2动作掩码在能量受限条件下的无人机路径规划中如何提升学习稳定性和安全性?
- RQ3折扣因子调度在多大程度上增强了智能体学习高效、完整覆盖轨迹的能力?
- RQ4位置历史机制在解决因充电能力导致的回溯状态循环问题方面有多有效?
- RQ5在DRL驱动的无人机路径规划中,性能专精(在已知地图上表现优异)与泛化能力(在未见地图上表现良好)之间存在何种权衡?
主要发现
- 所提出的基于PPO的DRL方法,结合动作掩码与折扣因子调度,在路径效率方面显著优于基线启发式方法,所有评估地图上均实现了更短的轨迹。
- 在10张多样化地图上训练的Multi10智能体,成功在之前未见过的Cal地图和Border地图上完成任务,展现出强大的零样本泛化能力。
- 在具有挑战性的Border地图上,针对该地图训练的专用智能体在约33%的评估场景中成功完成任务;而Multi10智能体也达到了33%的成功率,表明即使未专门针对该地图训练,仍具备强大泛化能力。
- 在Cal地图上,Multi10智能体的表现优于基线启发式方法(617步 vs. 435步,尽管专用智能体是针对该地图训练的),说明泛化能力并不意味着性能下降。
- 消融实验表明,动作掩码、折扣因子调度和位置历史机制均对学习性能和任务完成度有显著贡献。
- 研究揭示了明确的权衡关系:专用智能体在分布内地图上性能更高,而多地图泛化智能体在未见地图上泛化能力更强,提示未来可探索少样本或单样本泛化路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。