Skip to main content
QUICK REVIEW

[论文解读] Learning Generalizable Locomotion Skills with Hierarchical Reinforcement Learning

Tianyu Li, Nathan Lambert|arXiv (Cornell University)|Sep 26, 2019
Reinforcement Learning in Robotics参考文献 37被引用 4
一句话总结

该论文提出了一种分层强化学习框架,将无模型的循环运动基元学习与基于粗略动力学模型的模型化规划相结合,实现了在真实机器人上样本高效、可泛化的目标导向运动。该方法使一台18自由度的六足机器人仅通过两小时的硬件训练,便能从零开始学习到达最远12米外的目标,展现出对噪声和环境变化的鲁棒性。

ABSTRACT

Learning to locomote to arbitrary goals on hardware remains a challenging problem for reinforcement learning. In this paper, we present a hierarchical learning framework that improves sample-efficiency and generalizability of locomotion skills on real-world robots. Our approach divides the problem of goal-oriented locomotion into two sub-problems: learning diverse primitives skills, and using model-based planning to sequence these skills. We parametrize our primitives as cyclic movements, improving sample-efficiency of learning on a 18 degrees of freedom robot. Then, we learn coarse dynamics models over primitive cycles and use them in a model predictive control framework. This allows us to learn to walk to arbitrary goals up to 12m away, after about two hours of training from scratch on hardware. Our results on a Daisy hexapod hardware and simulation demonstrate the efficacy of our approach at reaching distant targets, in different environments and with sensory noise.

研究动机与目标

  • 解决真实世界足式机器人运动强化学习中的样本效率低下和泛化能力差的问题。
  • 实现在硬件上对任意未见过的目标进行目标导向运动策略的端到端学习,且具备泛化能力。
  • 通过直接在硬件上训练并提升数据效率,减少对仿真到真实迁移的依赖。
  • 开发一种可扩展的框架,将低层技能学习与高层目标规划分离。
  • 提升在真实世界部署过程中对传感噪声和环境变化的鲁棒性。

提出的方法

  • 将低层运动策略参数化为循环运动(例如向前行走、转向),以提升训练过程中的样本效率。
  • 使用无模型强化学习(Soft Actor-Critic)直接在硬件上训练这些循环策略。
  • 仅使用每种基元50次硬件采样,学习一个覆盖一个循环周期的粗略动力学模型。
  • 采用模型预测控制(MPC)结合粗略动力学模型,规划用于到达任意目标的基元序列。
  • 在高层控制器中引入方向引导奖励,以纠正全局位置感知中的漂移。
  • 将控制问题分解为两个阶段:首先学习多样化的基元,然后利用学习到的动力学模型规划其序列。
Figure 1 : The hexapod Daisy used in the experiments. Using our hierarchical control framework, Daisy learned from scratch to reach goals as far as 12 meters in 2 hours of training.
Figure 1 : The hexapod Daisy used in the experiments. Using our hierarchical control framework, Daisy learned from scratch to reach goals as far as 12 meters in 2 hours of training.

实验结果

研究问题

  • RQ1分层强化学习框架是否能提升真实世界运动学习中的样本效率和泛化能力?
  • RQ2对高自由度硬件机器人,循环参数化的运动策略是否能提升学习效率?
  • RQ3在极少量硬件数据上训练的粗略动力学模型,是否能实现对任意目标的有效长时程规划?
  • RQ4该框架在真实世界环境中对远距离目标、不同地形和传感噪声的泛化能力如何?
  • RQ5无模型与基于模型组件的结合是否能在真实世界运动中超越纯无模型或纯基于模型的方法?

主要发现

  • Daisy六足机器人在仅经过两小时直接硬件训练后,成功学习到达起始位置12米外的目标。
  • 系统在不同环境(包括不同地板类型和传感噪声)下均表现出稳健的泛化能力,无需重新训练。
  • 带有方向引导的高层控制器有效纠正了位置漂移,即使在存在跟踪误差的情况下也能实现精准目标到达。
  • 该框架在硬件实验中对单目标任务和顺序路径点任务均表现出可靠性能。
  • 仅使用每种基元50次样本训练的粗略动力学模型,成功实现了在基元空间中的高效且有效的规划。
  • 该方法首次在真实世界足式机器人上成功实现了混合无模型与基于模型的强化学习框架,用于目标导向运动。
Figure 2 : Hierarchical Control Flow Chart
Figure 2 : Hierarchical Control Flow Chart

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。