Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning for Motion Planning of Mobile Robots

Leonid Butyrev, Thorsten Edelhäußer|arXiv (Cornell University)|Dec 19, 2019
Robotic Path Planning Algorithms参考文献 23被引用 13
一句话总结

本文提出了一种基于深度强化学习(DRL)的运动规划框架,采用深度确定性策略梯度(DDPG)算法,在连续状态空间和动作空间中生成实时、运动学与动力学可行的轨迹。该方法在问题复杂度不断增加的情况下,实现了高达97.6%的成功率,且在动态环境中优于基于样条插值的基线方法,在时间效率和约束遵守方面表现更优。

ABSTRACT

This paper presents a novel motion and trajectory planning algorithm for nonholonomic mobile robots that uses recent advances in deep reinforcement learning. Starting from a random initial state, i.e., position, velocity and orientation, the robot reaches an arbitrary target state while taking both kinematic and dynamic constraints into account. Our deep reinforcement learning agent not only processes a continuous state space it also executes continuous actions, i.e., the acceleration of wheels and the adaptation of the steering angle. We evaluate our motion and trajectory planning on a mobile robot with a differential drive in a simulation environment.

研究动机与目标

  • 解决在频繁目标更新的高动态环境中,移动机器人实时运动规划的挑战。
  • 克服基于采样和基于插值的方法在最优性、完备性或约束遵守方面存在的局限性。
  • 通过DRL智能体实现连续的实时控制,直接从状态观测生成可行轨迹,无需预先计算运动基元。
  • 确保在轨迹执行过程中始终满足运动学与动力学约束。
  • 在目标状态持续更新的动态足球类场景中评估性能。

提出的方法

  • 在具有连续状态空间和动作空间的仿真环境中训练深度确定性策略梯度(DDPG)智能体。
  • 状态表示包括位置、速度、朝向以及目标状态(位置、速度、朝向),在最复杂情况下构成4维状态空间。
  • 动作为连续控制指令:轮子加速度与转向角调整。
  • 设计了自定义奖励函数,以鼓励以最小误差抵达目标状态、保持轨迹平滑性并遵守约束条件。
  • 环境模型模拟了物理动力学,包括差速驱动机器人的惯性和非完整约束。
  • 训练采用试错法,结合经验回放和目标网络以稳定学习过程。

实验结果

研究问题

  • RQ1DRL智能体是否能够在无预计算运动基元的情况下,在连续状态空间和动作空间中学习生成运动学与动力学可行的轨迹?
  • RQ2与基于样条插值的基线方法相比,DRL规划器在时间效率和约束遵守方面表现如何?
  • RQ3DRL智能体在具有动态目标更新的复杂高维运动规划任务中,其泛化能力如何?
  • RQ4在实时运动规划中,轨迹平滑性、时间效率与约束满足之间的权衡关系如何?
  • RQ5DRL智能体是否能在维度不断增加的问题中保持高成功率,同时满足所有物理约束?

主要发现

  • 在1,000轮测试中,DRL智能体在2D任务中实现100.0%成功率,3Da为99.9%,3db为99.0%,4D任务为97.6%。
  • 平均位置误差从2D的0.23 m增加到4D的0.39 m,角度误差从6.3°上升至10.3°,表明维度增加导致任务难度上升。
  • 速度误差从2D的0.14 m/s增加到4D的0.20 m/s,反映出运动控制复杂度的提升。
  • 4D智能体的轨迹平均长度为样条基线的1.29倍,但完全满足所有运动学与动力学约束,而样条方法在部分情况下失败。
  • 在2D、3Da和3db情况下,DRL生成的轨迹比样条基线更短(平均时长比分别为0.66、0.81和0.81)。
  • 在动态应用场景中,4D智能体成功实现了所有目标切换的平滑、约束合规轨迹,而基于样条的方法在第三和第四目标点之间违反了约束。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。