Skip to main content
QUICK REVIEW

[论文解读] MAPPER: Multi-Agent Path Planning with Evolutionary Reinforcement Learning in Mixed Dynamic Environments

Zuxin Liu, Baiming Chen|arXiv (Cornell University)|Jul 30, 2020
Robotic Path Planning Algorithms参考文献 28被引用 12
一句话总结

MAPPER 提出了一种去中心化、进化式的强化学习方法,用于在混合动态环境中进行多智能体路径规划,且不假设障碍物具有同质性。它采用基于图像的障碍物表示方法,通过全局规划实现目标分解,并结合进化训练机制,在复杂、大规模场景中实现了超过99%的成功率和稳定的性能表现,尤其适用于非合作性动态障碍物环境。

ABSTRACT

Multi-agent navigation in dynamic environments is of great industrial value when deploying a large scale fleet of robot to real-world applications. This paper proposes a decentralized partially observable multi-agent path planning with evolutionary reinforcement learning (MAPPER) method to learn an effective local planning policy in mixed dynamic environments. Reinforcement learning-based methods usually suffer performance degradation on long-horizon tasks with goal-conditioned sparse rewards, so we decompose the long-range navigation task into many easier sub-tasks under the guidance of a global planner, which increases agents' performance in large environments. Moreover, most existing multi-agent planning approaches assume either perfect information of the surrounding environment or homogeneity of nearby dynamic agents, which may not hold in practice. Our approach models dynamic obstacles' behavior with an image-based representation and trains a policy in mixed dynamic environments without homogeneity assumption. To ensure multi-agent training stability and performance, we propose an evolutionary training approach that can be easily scaled to large and complex environments. Experiments show that MAPPER is able to achieve higher success rates and more stable performance when exposed to a large number of non-cooperative dynamic obstacles compared with traditional reaction-based planner LRA* and the state-of-the-art learning-based method.

研究动机与目标

  • 解决在大规模、混合动态环境中,非合作性与异构性障碍物存在下的去中心化多智能体路径规划挑战。
  • 通过将长程目标分解为基于路点的子任务,克服强化学习在长时程、稀疏奖励导航任务中的局限性。
  • 通过基于图像的时空表示建模障碍物行为,消除对同质化运动模型或动态智能体完整信息的依赖。
  • 通过进化式强化学习框架,通过淘汰低性能策略来维持训练稳定性与可扩展性,确保在大规模多智能体系统中的稳定表现。
  • 在复杂、接近真实世界的情境中,性能优于传统反应式规划器和最先进的基于学习的方法。

提出的方法

  • 使用二维相对位置与速度网格表示动态障碍物的时空特征,实现对多样化障碍物行为的泛化,而无需显式建模运动规律。
  • 利用全局规划器将长距离导航任务分解为多个基于路点的子任务,以引导强化学习策略,提升样本效率与性能表现。
  • 集成全局规划器以生成参考路径与路点,作为局部策略的条件,使其在保持向远距离目标前进的同时,有效处理局部交互。
  • 实施进化训练策略,维护一个策略种群,评估其性能,并迭代替换低性能策略,从而提升训练稳定性与收敛性。
  • 采用端到端的深度强化学习方法训练局部策略,使用密集的形状奖励(源自与路点的距离)和稀疏密集奖励(用于目标达成)进行奖励设计。
  • 采用课程学习方法,逐步增加环境复杂度:从较小地图与较少智能体开始,逐步扩展至更大地图与更高障碍物密度。

实验结果

研究问题

  • RQ1去中心化、部分可观测的多智能体强化学习方法是否能在包含非合作性与异构性动态障碍物的大规模复杂环境中实现高成功率?
  • RQ2将长时程导航任务分解为基于路点的子任务,是否能显著提升深度强化学习在多智能体路径规划中的样本效率与性能表现?
  • RQ3基于图像的障碍物表示是否能有效建模多样化动态障碍物行为,而无需假设运动同质性或显式运动估计?
  • RQ4所提出的进化式训练框架是否在收敛稳定性与大规模多智能体系统的可扩展性方面优于标准的集中式训练方法?
  • RQ5MAPPER 方法在不同智能体数量与动态障碍物数量的环境中是否具备良好的泛化能力,尤其与 LRA* 和 PRIMAL* 相比表现如何?

主要发现

  • 在包含10个智能体与10个动态障碍物的多样化仿真环境中,MAPPER 的成功率始终高于0.99,即使目标采样范围扩大至65×65网格,表现依然稳定。
  • 不依赖全局规划器引导的 MAPPER 变体在目标距离增加时性能显著下降,证明了基于路点的子任务分解在提升性能中的关键作用。
  • 不包含动态障碍物轨迹表示的 MAPPER 变体在高密度障碍物环境中表现欠佳,证实了基于图像的障碍物建模在处理复杂交互中的重要性。
  • MAPPER 展现出最稳定的训练收敛过程与最低的奖励方差,在训练稳定性和最终性能方面优于 PRIMAL* 与 LRA*。
  • 在高动态障碍物密度环境中,MAPPER 智能体能够主动重规划并机动避开阻塞路径,而 LRA* 因依赖完整智能体意图信息与集中式冲突解决机制而失效。
  • 进化式训练方法使 MAPPER 在大规模复杂环境中实现了稳定且可扩展的训练,即使从4个智能体扩展至20个智能体与30个动态障碍物,也能成功收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。