Skip to main content
QUICK REVIEW

[论文解读] Distributed Heuristic Multi-Agent Path Finding with Communication

Ziyuan Ma, Yudong Luo|arXiv (Cornell University)|Jun 21, 2021
Reinforcement Learning in Robotics参考文献 38被引用 6
一句话总结

本文提出DHC(分布式启发式多智能体路径规划通信),一种基于图卷积通信与所有潜在最短路径启发引导的深度Q-learning方法,实现了去中心化、可扩展且协作式的多智能体路径规划。通过学习理性的路径选择与协调行为,该方法在稀疏与拥堵环境中均实现了高成功率与低平均步数,且无需集中式规划或限制性假设。

ABSTRACT

Multi-Agent Path Finding (MAPF) is essential to large-scale robotic systems. Recent methods have applied reinforcement learning (RL) to learn decentralized polices in partially observable environments. A fundamental challenge of obtaining collision-free policy is that agents need to learn cooperation to handle congested situations. This paper combines communication with deep Q-learning to provide a novel learning based method for MAPF, where agents achieve cooperation via graph convolution. To guide RL algorithm on long-horizon goal-oriented tasks, we embed the potential choices of shortest paths from single source as heuristic guidance instead of using a specific path as in most existing works. Our method treats each agent independently and trains the model from a single agent's perspective. The final trained policy is applied to each agent for decentralized execution. The whole system is distributed during training and is trained under a curriculum learning strategy. Empirical evaluation in obstacle-rich environment indicates the high success rate with low average step of our method.

研究动机与目标

  • 解决在具有同时移动行为的大规模、部分可观测多智能体环境中学习无碰撞、协作策略的挑战。
  • 通过嵌入所有最短路径的启发式引导,提升深度强化学习在长时程目标导向任务中在MAPF中的泛化性与可扩展性。
  • 通过使用图卷积的去中心化通信,实现在拥堵环境中的有效协作。
  • 训练单个可复用的策略,使每个智能体的策略可扩展至大量智能体,且无需联合动作值学习。
  • 开发一种分布式且基于课程学习的训练框架,提升样本效率与收敛性。

提出的方法

  • 该方法使用深度Q网络,每个智能体的观测包括障碍物位置、邻近智能体位置、目标位置预测以及其自身的目标位置。
  • 通过将所有从起点到目标的潜在最短路径作为通道嵌入,实现对理性路径选择的自我学习。
  • 使用多头注意力的图卷积来建模智能体间关系,并实现邻近智能体之间的通信。
  • 模型采用分布式Ape-X框架与课程学习进行训练,智能体从单智能体视角独立训练。
  • 推理阶段,所有智能体执行相同的去中心化策略,同时移动,并在到达目标后保留在环境中。
  • 该方法避免集中式规划,且不依赖单路径形状或专家演示,从而提升泛化能力。

实验结果

研究问题

  • RQ1所有潜在最短路径的启发式引导是否能提升长时程多智能体路径规划中的样本效率与性能?
  • RQ2通过图卷积实现的去中心化通信是否能增强密集多智能体环境中的协作并减少碰撞?
  • RQ3在无需联合动作值学习的情况下,单智能体训练的策略是否能有效泛化至大规模去中心化多智能体系统?
  • RQ4启发式引导与通信的结合在稀疏与拥堵环境下的成功率与路径效率方面有何影响?
  • RQ5课程学习与分布式训练在多大规模多智能体路径规划任务中对收敛性与可扩展性的提升程度如何?

主要发现

  • 在64个智能体、障碍物密度30%的40×40地图中,DHC的成功率为92.5%,平均步数为163.50,显著优于PRIMAL(170.48步)与基线方法(170.48步)。
  • 在128个智能体、障碍物密度30%的80×80地图中,DHC的成功率为91.2%,平均步数为163.50,而PRIMAL需321.63步,表明其具备更优的可扩展性与效率。
  • 消融实验表明,移除启发式引导在长时程任务中导致性能急剧下降,证实其在路径选择引导中的关键作用。
  • 通信组件(图卷积)在密集环境(如40×40地图中64个智能体)中将成功率提升最高达20%,证明其在协调中的有效性。
  • DHC从40×40地图扩展至80×80地图时,步数仅从134.42增至163.50(128个智能体),而PRIMAL则从250.07增至321.63步,表明DHC对更大环境的泛化能力更强。
  • DHC/Comm变体(无通信)在密集场景中表现欠佳,证实通信对处理拥堵与避免死锁至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。