Skip to main content
QUICK REVIEW

[论文解读] Mobile Robot Path Planning in Dynamic Environments through Globally Guided Reinforcement Learning

Binyu Wang, Zhe Liu|arXiv (Cornell University)|May 11, 2020
Reinforcement Learning in Robotics参考文献 22被引用 15
一句话总结

本文提出 G2RL,一种面向动态环境中移动机器人路径规划的全局引导强化学习框架。通过将固定全局路径(例如 A* 算法生成的路径)与使用密集、环境无关奖励的局部深度 Q 网络相结合,G2RL 实现了可扩展、分布式且泛化能力强的导航。该方法在无需全局轨迹知识的前提下,优于现有分布式方法,并在多机器人场景中达到集中式基准的性能水平。

ABSTRACT

Path planning for mobile robots in large dynamic environments is a challenging problem, as the robots are required to efficiently reach their given goals while simultaneously avoiding potential conflicts with other robots or dynamic objects. In the presence of dynamic obstacles, traditional solutions usually employ re-planning strategies, which re-call a planning algorithm to search for an alternative path whenever the robot encounters a conflict. However, such re-planning strategies often cause unnecessary detours. To address this issue, we propose a learning-based technique that exploits environmental spatio-temporal information. Different from existing learning-based methods, we introduce a globally guided reinforcement learning approach (G2RL), which incorporates a novel reward structure that generalizes to arbitrary environments. We apply G2RL to solve the multi-robot path planning problem in a fully distributed reactive manner. We evaluate our method across different map types, obstacle densities, and the number of robots. Experimental results show that G2RL generalizes well, outperforming existing distributed methods, and performing very similarly to fully centralized state-of-the-art benchmarks.

研究动机与目标

  • 解决传统重规划方法与基于学习的方法在动态、大规模环境中所面临的局限性。
  • 克服深度强化学习在机器人路径规划中稀疏奖励与泛化能力差的问题。
  • 实现在无需全局轨迹信息的前提下,可扩展的全分布式多机器人路径规划。
  • 设计一种支持在多样化环境中实现密集、泛化性学习的奖励结构。

提出的方法

  • 该方法采用分层框架:由全局路径(例如通过 A* 算法生成)提供固定引导,而局部 DQN 代理则基于局部观测学习动作。
  • 提出一种新型奖励函数,结合与全局路径的距离和向目标的前进进度,提供密集且与环境无关的奖励。
  • 局部强化学习代理观测包含静态与动态障碍物的局部视野,从而实现实时冲突避免。
  • 该方法为全分布式——机器人之间不通信也不共享轨迹,支持机器人数量的线性可扩展性。
  • 同一套单机器人训练模型可直接应用于多机器人场景,无需重新训练。
  • 该方法在不改变网络架构或奖励函数的前提下,可泛化至不同地图类型、障碍物密度及机器人数量。

实验结果

研究问题

  • RQ1基于学习的方法是否能在无需微调的情况下,泛化至未见过的多样化环境中?
  • RQ2在动态多机器人路径规划中,全局引导强化学习相较于重规划方法及其他分布式强化学习方法表现如何?
  • RQ3固定大小的模型是否能在大规模环境中实现与集中式全知规划器相当的性能?
  • RQ4密集且与环境无关的奖励函数是否能提升稀疏奖励导航任务中的样本效率与泛化能力?

主要发现

  • 在所有测试的地图类型与障碍物密度下,G2RL 在成功率与流程时间方面均优于局部与全局重规划方法。
  • 在多机器人路径规划中,G2RL 的成功率与 ECBS 和 HCA* 相当,而后者为集中式方法且假设已知所有机器人的轨迹。
  • 在拥挤与复杂环境中,G2RL 优于 Discrete-ORCA 与 PRIMAL,尤其在避免死锁方面表现更优,而 PRIMAL 在此类场景中会失效。
  • 该方法在 40×40 地图上对多达 128 台机器人、静态障碍物密度在 0.15 至 0.45 之间变化的情况下,均保持一致的性能表现。
  • 每步计算时间经过归一化处理,与 PRIMAL 和 Discrete-ORCA 相当,且在高密度场景中表现出更优的鲁棒性。
  • 该方法泛化效果良好:单机器人训练的模型可直接应用于多机器人场景,无需微调或架构修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。