[论文解读] Obstacle-aware Waypoint Generation for Long-range Guidance of Deep-Reinforcement-Learning-based Navigation Approaches
本文提出了一种分层导航系统,通过基于时间的Delaunay三角剖分实现障碍物感知的航点生成,并在状态-时间空间中采用扩展的混合A*搜索算法,以指导深度强化学习(DRL)基局部规划器在长距离、动态环境中的导航。该方法在障碍物速度为0.3–0.5 m/s时实现了100%的成功率,碰撞率显著降低(11–10次碰撞),在安全性、鲁棒性和效率方面优于基线子目标方法。
Navigation of mobile robots within crowded environments is an essential task in various use cases, such as delivery, health care, or logistics. Deep Reinforcement Learning (DRL) emerged as an alternative method to replace overly conservative approaches and promises more efficient and flexible navigation. However, Deep Reinforcement Learning is limited to local navigation due to its myopic nature. Previous research works proposed various ways to combine Deep Reinforcement Learning with conventional methods but a common problem is the complexity of highly dynamic environments due to the unpredictability of humans and other objects within the environment. In this paper, we propose a hierarchical waypoint generator, which considers moving obstacles and thus generates safer and more robust waypoints for Deep-Reinforcement-Learning-based local planners. Therefore, we utilize Delaunay Triangulation to encode obstacles and incorporate an extended hybrid A-Star approach to efficiently search for an optimal solution in the time-state space. We compared our waypoint generator against two baseline approaches and outperform them in terms of safety, efficiency, and robustness.
研究动机与目标
- 为解决DRL基局部规划器在长距离导航中视野受限的问题,提供稳健且动态的全局引导。
- 在移动障碍物快速变化的高动态环境中提升安全性与效率,其中静态全局路径会迅速失效。
- 通过生成随时间保持有效的、障碍物感知的自适应子目标,减少对频繁全局重规划的依赖。
- 通过分层框架将基于模型的规划与DRL局部规划相结合,平衡全局感知与局部适应能力。
- 在成功率、碰撞次数与计算效率方面,将所提出的航点生成器与基线方法进行对比评估。
提出的方法
- 使用时间Delaunay三角剖分在状态-时间空间中编码移动障碍物,实现高效的时空障碍物表示。
- 采用扩展的混合A*搜索算法,在时间-状态空间中计算近似最优轨迹,综合考虑动态障碍物的位置与速度。
- 应用无ESDF的基于梯度的轨迹优化(EGO)方法,对初始路径进行精细化处理,确保轨迹平滑且无碰撞。
- 从优化后的轨迹中生成稀疏的地标航点作为子目标,供DRL局部规划器使用,以指导长距离导航。
- 将中层规划器与基于DRL的局部规划器集成,使航点作为短期目标,缓解DRL规划器视野受限的问题。
- 采用基于地标的选择策略以降低全局重规划的计算成本,提升在大规模环境中的可扩展性。
实验结果
研究问题
- RQ1障碍物感知的航点生成是否能提升DRL基导航在高度动态环境中的安全性和鲁棒性?
- RQ2在状态-时间空间中考虑移动障碍物对长距离导航的成功率与碰撞率有何影响?
- RQ3与基线方法相比,所提方法在多大程度上减少了对频繁全局重规划的依赖?
- RQ4在效率与鲁棒性方面,所提航点生成器与静态及子采样航点方法相比表现如何?
- RQ5将基于模型的全局引导与DRL局部规划相结合,是否能在复杂动态场景中实现更高的成功率?
主要发现
- 所提出的ST-WP方法在20个障碍物、速度为0.3 m/s与0.5 m/s的场景中实现了100%的成功率,显著优于SH-WP(超过60%)与SUB-WP(超过35%)。
- 在0.5 m/s的障碍物速度下,SH-WP与SUB-WP的成功率分别下降至超过50%与超过10%,而ST-WP保持100%的成功率。
- ST-WP方法在0.3 m/s时仅发生11次碰撞,0.5 m/s时低于10次,而两种基线方法的碰撞次数均超过25次。
- ST-WP方法在效率方面略优于基线方法,其中SUB-WP方法效率最低,因其需冗余地遍历所有子目标。
- ST-WP方法即使在高障碍物速度下仍能维持稳定且直接的轨迹,而SH-WP与SUB-WP生成了迂回路径,尤其在11,11坐标点附近更为明显。
- 在状态-时间空间中对动态障碍物进行建模,使系统即使在障碍物高度不可预测的情况下也能维持路径有效性与安全性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。