[论文解读] Multi-agent navigation based on deep reinforcement learning and traditional pathfinding algorithm
该论文提出了一种混合框架,结合深度强化学习(DRL)与传统路径规划算法,以解决复杂动态环境中多智能体导航与碰撞避免问题。通过利用DRL学习实时决策,同时借助A*算法进行全局路径规划,该方法在无需微调的情况下,实现了更高的成功率、更低的路径成本(EDP),并在各种场景下展现出强大的泛化能力,尤其在大规模场景下表现优异。
We develop a new framework for multi-agent collision avoidance problem. The framework combined traditional pathfinding algorithm and reinforcement learning. In our approach, the agents learn whether to be navigated or to take simple actions to avoid their partners via a deep neural network trained by reinforcement learning at each time step. This framework makes it possible for agents to arrive terminal points in abstract new scenarios. In our experiments, we use Unity3D and Tensorflow to build the model and environment for our scenarios. We analyze the results and modify the parameters to approach a well-behaved strategy for our agents. Our strategy could be attached in different environments under different cases, especially when the scale is large.
研究动机与目标
- 解决高密度智能体在动态环境中可扩展的、无碰撞的多智能体导航挑战。
- 克服纯强化学习在未见场景中样本效率低和泛化能力差的局限性。
- 将传统路径规划(A*)与深度强化学习相结合,以提升多智能体系统中的可靠性与效率。
- 开发一种无需微调即可在不同环境和智能体数量下泛化的策略。
提出的方法
- 该框架使用深度Q网络(DQN)通过强化学习学习导航策略,其中智能体决定是遵循预计算的A*路径,还是采取避让动作。
- 在每个时间步,DRL智能体根据学习到的策略评估其状态并采取动作(如移动、避让),基于来自8D距离传感器的观测。
- A*算法离线生成无碰撞的全局路径,作为DRL智能体优化局部决策的参考。
- 使用包含4或8个全连接层的多层感知机(MLP)处理状态输入,并输出DRL策略的动作概率。
- 奖励函数鼓励快速抵达目标,同时惩罚碰撞和过度的路径偏离。
- 系统在Unity3D中使用TensorFlow进行训练,模拟了包括四面墙、随机障碍物和环形运输在内的多种场景。
实验结果
研究问题
- RQ1在不同智能体密度和环境条件下,混合DRL与路径规划方法是否优于纯强化学习在多智能体导航中的表现?
- RQ2训练好的策略在未见场景中是否能实现良好泛化而无需微调?
- RQ3与端到端强化学习相比,结合A*路径规划与DRL是否能提升样本效率和收敛速度?
- RQ4神经网络深度(4层与8层全连接层)对策略性能和鲁棒性有何影响?
- RQ5在复杂拥挤环境中,随着智能体数量增加,该方法的可扩展性如何?
主要发现
- 在基础场景中,所提方法在N=40时实现了98.4%的成功率,EDP为0.516 ± 0.218,优于纯RL方法(98.3%成功率,EDP 0.573 ± 0.236)。
- 在N=200时,该方法保持96.1%的成功率(8层全连接),EDP为0.866 ± 0.425,而纯RL方法成功率下降至53.2%。
- 在十字路口场景中,该方法在N=40时实现99.9%成功率,在N=160时为92.3%,碰撞率接近零。
- 在四面墙场景中,该方法在N=30时实现96.9%成功率,碰撞率仅为3%,而纯RL方法为36%。
- 在基础场景中训练的策略能良好泛化至新场景(如环形运输、随机障碍物),在十字路口场景中实现99.9%成功率,在RO-N=120场景中实现96.0%成功率。
- 该方法在不同地图类型和智能体数量下均表现出强鲁棒性,EDP和碰撞率始终低于纯RL方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。