Skip to main content
QUICK REVIEW

[论文解读] Multi-Agent Path Planning based on MPC and DDPG

Junxiao Xue, Xiangyan Kong|arXiv (Cornell University)|Feb 26, 2021
Robotic Path Planning Algorithms参考文献 22被引用 4
一句话总结

该论文提出了一种混合MPC-DDPG框架,用于在具有静态和动态障碍物的动态环境中进行多智能体路径规划。通过结合模型预测控制(MPC)进行动态障碍物轨迹预测,以及使用深度确定性策略梯度(DDPG)进行连续动作空间决策,该方法相较于DQN,路径精度提升了7–30%,路径长度减少了100个单位,转向角度减少了400–450°,并在Unity3D模拟的航空母舰甲板和城市广场环境中表现出更优的学习稳定性和平滑性。

ABSTRACT

The problem of mixed static and dynamic obstacle avoidance is essential for path planning in highly dynamic environment. However, the paths formed by grid edges can be longer than the true shortest paths in the terrain since their headings are artificially constrained. Existing methods can hardly deal with dynamic obstacles. To address this problem, we propose a new algorithm combining Model Predictive Control (MPC) with Deep Deterministic Policy Gradient (DDPG). Firstly, we apply the MPC algorithm to predict the trajectory of dynamic obstacles. Secondly, the DDPG with continuous action space is designed to provide learning and autonomous decision-making capability for robots. Finally, we introduce the idea of the Artificial Potential Field to set the reward function to improve convergence speed and accuracy. We employ Unity 3D to perform simulation experiments in highly uncertain environment such as aircraft carrier decks and squares. The results show that our method has made great improvement on accuracy by 7%-30% compared with the other methods, and on the length of the path and turning angle by reducing 100 units and 400-450 degrees compared with DQN (Deep Q Network), respectively.

研究动机与目标

  • 解决传统基于网格的路径规划在动态环境中因人工航向约束而导致路径次优的问题。
  • 克服Q学习和DQN在高维、连续动作空间中面对动态障碍物时收敛性差和泛化能力有限的问题。
  • 提升在复杂、不确定环境(如航空母舰甲板和城市广场)中的路径规划精度和平滑性。
  • 将预测控制与深度强化学习相结合,以增强在实时、动态场景中的决策鲁棒性。
  • 开发一种基于学习的路径规划系统,支持连续动作空间,并能实时适应移动障碍物。

提出的方法

  • 采用模型预测控制(MPC)预测动态障碍物的未来轨迹,以减少环境不确定性。
  • 使用具有连续动作空间的深度确定性策略梯度(DDPG),使智能体能够通过试错学习最优导航策略。
  • 设计一种受人工势场启发的奖励函数,其中目标吸引智能体,障碍物排斥智能体,以加速收敛并提升路径质量。
  • 使用运动学模型对智能体动力学进行建模,以在训练和推理过程中反映真实世界中的运动约束。
  • 在MPC中实现滚动时域优化框架,以在每个时间步更新预测和控制动作。
  • 在Unity3D中模拟环境中训练DDPG智能体,状态空间包括智能体位置、目标位置和障碍物位置,动作空间包括速度和转向指令。

实验结果

研究问题

  • RQ1基于MPC的障碍物轨迹预测是否能显著提升多智能体在动态环境中路径规划的精度和鲁棒性?
  • RQ2与标准的DQN和A2C相比,将DDPG与MPC结合是否能提升连续动作空间中的学习稳定性和收敛速度?
  • RQ3受人工势场启发的奖励函数在复杂、不确定环境中在多大程度上提升了路径平滑性和收敛速度?
  • RQ4在环境复杂度不断增加的情况下,该方法与DQN、A2C和DDPG相比,在路径长度、转向角度和精度方面表现如何?
  • RQ5该混合MPC-DDPG框架是否能有效处理实时动态障碍物避让,同时保持最优且平滑的轨迹?

主要发现

  • 在场景1中,所提出的MPC-DDPG方法相较于DQN路径规划精度提升了8%,相较于A2C提升了6%,相较于DDPG提升了31%;在更复杂的场景2中,精度仍保持在91%。
  • 与DQN相比,该方法在场景1中将平均路径长度减少了100个单位(从438.22降至328.95),平均转向角度减少了450度(从586.73°降至139.80°)。
  • 在场景2中,与DQN相比,该方法将路径长度减少了150个单位(从465.45降至315.68),转向角度减少了394度(从522.62°降至128.41°)。
  • 该方法的平均奖励稳定在约150,优于A2C(100),且相比DDPG具有更好的稳定性,表明其学习效率更优。
  • 该方法表现出更优的路径平滑性和实时适应能力,路径长度和转向角度更低,表明资源效率和任务及时性得到提升。
  • 将MPC用于障碍物预测显著增强了算法在动态环境中泛化能力和避免局部极小值的能力,优于纯反应式或非预测性方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。