[论文解读] Robot Navigation with Map-Based Deep Reinforcement Learning
该论文提出了一种基于地图的深度强化学习方法,用于机器人导航,通过课程学习和优先经验回放,直接将自身视角的局部占用图映射为转向指令,采用双 dueling double DQN。该方法在仿真和真实世界部署中均实现了稳健的实时障碍物避让,相较于以往基于 DRL 的模型,在成功率、轨迹平滑度和抗噪声能力方面表现更优。
This paper proposes an end-to-end deep reinforcement learning approach for mobile robot navigation with dynamic obstacles avoidance. Using experience collected in a simulation environment, a convolutional neural network (CNN) is trained to predict proper steering actions of a robot from its egocentric local occupancy maps, which accommodate various sensors and fusion algorithms. The trained neural network is then transferred and executed on a real-world mobile robot to guide its local path planning. The new approach is evaluated both qualitatively and quantitatively in simulation and real-world robot experiments. The results show that the map-based end-to-end navigation model is easy to be deployed to a robotic platform, robust to sensor noise and outperforms other existing DRL-based models in many indicators.
研究动机与目标
- 解决在具有未知障碍物的动态、杂乱环境中实现安全且稳健的移动机器人导航的挑战。
- 克服传统导航方法依赖人工参数调优且难以泛化到未见场景的局限性。
- 开发一种样本高效、端到端的深度强化学习策略,能够从仿真良好泛化到真实世界部署。
- 提高对传感器噪声的鲁棒性,实现实时、反应式的导航,而无需完美感知或大量人工标注。
- 通过占用图输入,实现训练策略从仿真到真实机器人平台的无缝迁移。
提出的方法
- 使用来自 2D 激光扫描生成的自身视角局部占用图作为输入,以表示机器人的周围环境。
- 采用双 dueling double DQN 架构来估计 Q 值,通过分离状态值和动作值,提升样本效率。
- 集成优先经验回放,聚焦于高影响力经验的学习,加速收敛。
- 通过在训练过程中逐步增加环境复杂度,应用课程学习,以提升策略的泛化能力。
- 在仿真环境中使用密集奖励、稀疏奖励和塑形奖励训练策略,以鼓励抵达目标并避免障碍物。
- 将训练好的策略直接迁移到配备 Hokuyo UTM-30LX 激光测距仪的差速驱动机器人上。
实验结果
研究问题
- RQ1基于地图的端到端 DRL 策略是否能在复杂、动态环境中实现稳健、实时的导航,且人类干预极少?
- RQ2与标准训练相比,课程学习在提升 DRL 导航策略的样本效率和泛化能力方面有何改善?
- RQ3所提出方法在存在传感器噪声和环境不确定性的情况下,从仿真到真实世界部署的泛化程度如何?
- RQ4在成功率和轨迹平滑度方面,基于地图的 DRL 策略相较于传统方法(如 VFH)和其他 DRL 基线模型表现如何?
- RQ5传感器噪声对所学习策略的鲁棒性影响如何,相较于传统反应式方法?
主要发现
- 课程化 DQN 策略在复杂障碍物场景中实现了 94% 的成功率,优于普通 DQN(91%)和 PPO(1D 卷积)(85%)。
- 课程化 DQN 将平均到达步数减少至 26.13,显著低于 PPO(40.19)和普通 DQN(27.76),表明导航更高效。
- 平均角速度变化为 0.35,表明轨迹更平滑,优于 PPO(0.46)和普通 DQN(0.39)。
- 在传感器噪声下训练的 DQN 策略在真实世界条件下泛化能力更强,即使在噪声激光数据下仍保持高成功率。
- 该方法对激光噪声表现出强鲁棒性,性能下降程度远低于传统 VFH 方法。
- 真实世界实验验证了在有障碍物和行人的走廊中成功导航,证实了策略的可迁移性和实时性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。