Skip to main content
QUICK REVIEW

[论文解读] PPMC RL Training Algorithm: Rough Terrain Intelligent Robots through Reinforcement Learning

Tamir Blum, Kazuya Yoshida|arXiv (Cornell University)|Mar 2, 2020
Robotic Path Planning Algorithms参考文献 16被引用 5
一句话总结

本文提出了一种基于强化学习的路径规划与运动控制训练算法(PPMC RL Training Algorithm),这是一种通用的基于强化学习的框架,使机器人能够在崎岖不平的地形中端到端地学习导航与控制。该算法在轮式和四足机器人上均实现了对未见过的崎岖地形地图的100%成功率,展示了出色的泛化能力与运动控制鲁棒性,且无需事先了解环境信息。

ABSTRACT

Robots can now learn how to make decisions and control themselves, generalizing learned behaviors to unseen scenarios. In particular, AI powered robots show promise in rough environments like the lunar surface, due to the environmental uncertainties. We address this critical generalization aspect for robot locomotion in rough terrain through a training algorithm we have created called the Path Planning and Motion Control (PPMC) Training Algorithm. This algorithm is coupled with any generic reinforcement learning algorithm to teach robots how to respond to user commands and to travel to designated locations on a single neural network. In this paper, we show that the algorithm works independent of the robot structure, demonstrating that it works on a wheeled rover in addition the past results on a quadruped walking robot. Further, we take several big steps towards real world practicality by introducing a rough highly uneven terrain. Critically, we show through experiments that the robot learns to generalize to new rough terrain maps, retaining a 100% success rate. To the best of our knowledge, this is the first paper to introduce a generic training algorithm teaching generalized PPMC in rough environments to any robot, with just the use of reinforcement learning.

研究动机与目标

  • 开发一种通用的强化学习训练算法,使机器人能够在崎岖不平的地形中泛化路径规划与运动控制能力。
  • 证明PPMC RL算法与机器人构型或运动模式无关,突破以往仅针对四足机器人的研究局限。
  • 验证该算法能够泛化至未见过的、高度不规则的地形地图,包括比训练环境更具挑战性的地形。
  • 通过纯强化学习训练,在类真实世界的仿真场景(如月球表面模拟)中实现高可靠性和高成功率。
  • 通过单一神经网络实现导航与控制的端到端学习,降低对人工设计控制系统的依赖。

提出的方法

  • PPMC RL训练算法采用三元强化学习架构(包含智能体、用户和环境组件),将路径规划与运动控制整合为单一深度强化学习策略。
  • 该算法使用奖励函数,引导智能体在避开障碍物并保持在崎岖地形上稳定的同时,抵达用户指定的目标位置。
  • 训练在模拟环境中进行,使用高度不规则、布满颠簸的地形地图(地图1),以模拟月球表面条件。
  • 策略采用ACKTR算法进行训练,这是一种用于稳定高效深度强化学习训练的信赖域方法。
  • 泛化性能在两张新的、未见过的崎岖地形地图(地图2和地图3)上进行评估,测试其在多样化和复杂地形上的表现。
  • 该方法在轮式CLOVER探测车和先前已验证的四足机器人上均进行了验证,确认了其架构无关性。

实验结果

研究问题

  • RQ1单一基于强化学习的训练算法是否能够实现对未见过的崎岖地形在路径规划与运动控制上的泛化?
  • RQ2PPMC RL算法是否在不同机器人形态(如轮式与腿式平台)上均保持高性能?
  • RQ3智能体是否仅通过强化学习即可学会在复杂不规则地形中执行顺时针与逆时针转弯?
  • RQ4是否可能仅通过端到端强化学习在多样化、此前未见过的崎岖地形地图上实现100%的导航成功率?
  • RQ5该算法在多大程度上减少了对人工设计控制系统的依赖或对特定环境的调优需求?

主要发现

  • PPMC RL训练算法在全部12个测试案例中(每张未见过的崎岖地形地图上4个起始位置)均实现了100%的成功率,证明了其强大的泛化能力。
  • 该算法成功使轮式探测车(CLOVER)和四足机器人均能导航复杂不规则地形,证实其与机器人架构无关。
  • 智能体学会了在崎岖地形中执行顺时针与逆时针转弯,表明其运动控制学习效果良好。
  • 该算法不仅泛化至比训练环境更粗糙的地形,也适用于较平缓的地形,显示出对环境变化的强适应能力。
  • 系统在无需专家示范或混合控制系统的前提下,保持了高可靠性和高性能,完全依赖强化学习实现。
  • 该结果是首次已知的、在多种机器人类型和未见过的地图上实现纯强化学习在崎岖地形导航中的泛化应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。