Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning to Acquire Navigation Skills for Wheel-Legged Robots in Complex Environments

Xi Chen, Ali Ghadirzadeh|arXiv (Cornell University)|Apr 27, 2018
Reinforcement Learning in Robotics参考文献 20被引用 8
一句话总结

本文提出一种深度强化学习方法,将复杂的轮腿机器人导航任务分解为可管理的子行为,并利用领域随机化提升样本效率和任务相关注意力。通过训练将高度图观测映射到电机指令的策略,该方法在复杂环境中实现了更高的轨迹质量和障碍物感知能力,成功率达到最先进方法的20%以上。

ABSTRACT

Mobile robot navigation in complex and dynamic environments is a challenging but important problem. Reinforcement learning approaches fail to solve these tasks efficiently due to reward sparsities, temporal complexities and high-dimensionality of sensorimotor spaces which are inherent in such problems. We present a novel approach to train action policies to acquire navigation skills for wheel-legged robots using deep reinforcement learning. The policy maps height-map image observations to motor commands to navigate to a target position while avoiding obstacles. We propose to acquire the multifaceted navigation skill by learning and exploiting a number of manageable navigation behaviors. We also introduce a domain randomization technique to improve the versatility of the training samples. We demonstrate experimentally a significant improvement in terms of data-efficiency, success rate, robustness against irrelevant sensory data, and also the quality of the maneuver skills.

研究动机与目标

  • 解决深度强化学习在移动机器人导航中面临的数据效率低下、稀疏奖励和时间信用分配问题。
  • 提升在高维、动态环境中复杂障碍物场景下的策略泛化能力和鲁棒性。
  • 使轮腿机器人能够学习包含身体重构(如抬升、瘦身)的导航技能,以穿越狭窄或不平坦地形。
  • 引导策略仅关注任务相关的感官线索(如路径上的障碍物),而忽略无关线索。
  • 与现有深度强化学习基线相比,证明在成功率和轨迹质量方面表现更优。

提出的方法

  • 该方法将导航任务分解为多个可管理的子行为,分别独立训练,以简化策略学习。
  • 使用成功示范的轨迹批次训练主策略,以提升样本效率并缓解稀疏奖励问题。
  • 应用领域随机化通过变化环境参数(如障碍物位置、纹理)增强训练数据,提升策略的鲁棒性和泛化能力。
  • 策略直接将高度图图像映射到电机指令,实现端到端的视觉到控制学习,无需人工设计特征。
  • 采用课程学习风格的训练策略,先训练次级策略,再利用其生成高质量轨迹供主策略使用。
  • 通过测量移除障碍物时轨迹的变化,使模型学会关注相关障碍物,实现对路径阻挡元素的选择性注意力。

实验结果

研究问题

  • RQ1将复杂的导航任务分解为子行为,是否能提升轮腿机器人在深度强化学习中的样本效率和成功率?
  • RQ2领域随机化在视觉导航中如何增强策略泛化能力并减少对无关感官输入的依赖?
  • RQ3深度强化学习策略在多大程度上能够仅关注任务相关的环境组件(如机器人路径上的障碍物)?
  • RQ4在训练中使用成功示范的轨迹批次,是否能提升主策略的成功率和轨迹质量,相比标准强化学习训练?
  • RQ5所提出方法是否能在复杂、动态环境中,同时优于最先进强化学习基线在成功率和鲁棒性方面的表现?

主要发现

  • 所提方法在具有挑战性的导航任务中,相比最先进强化学习基线,成功率高出20%。
  • 在训练中使用轨迹批次后,生成无碰撞轨迹的成功率从基线的55%提升至80%。
  • 所提方法生成的轨迹平均比基线短10步,表明效率更高。
  • 策略成功学会关注任务相关的障碍物——即阻挡路径或靠近当前轨迹的障碍物——而忽略远处或无关的障碍物。
  • 当场景中移除障碍物时,模型对无关感官数据表现出鲁棒性,性能保持一致。
  • 主策略和次级策略的学习曲线均显示平滑且持续的改进,表明训练动力学稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。