Skip to main content
QUICK REVIEW

[论文解读] Rapid Locomotion via Reinforcement Learning

Gabriel B. Margolis, Ge Yang|arXiv (Cornell University)|May 5, 2022
Robotic Locomotion and Control被引用 6
一句话总结

本文提出了一种面向MIT Mini Cheetah的端到端强化学习控制器,实现了创纪录的敏捷性,在草地、冰面和碎石等多种地形上均能维持最高3.9 m/s的速度。该方法采用自适应课程策略调整速度指令,并结合在线系统辨识,实现了零样本仿真到现实的迁移,使机器人能够在无视觉或手工设计模型的前提下实现高速奔跑、旋转以及对扰动的鲁棒响应。

ABSTRACT

Agile maneuvers such as sprinting and high-speed turning in the wild are challenging for legged robots. We present an end-to-end learned controller that achieves record agility for the MIT Mini Cheetah, sustaining speeds up to 3.9 m/s. This system runs and turns fast on natural terrains like grass, ice, and gravel and responds robustly to disturbances. Our controller is a neural network trained in simulation via reinforcement learning and transferred to the real world. The two key components are (i) an adaptive curriculum on velocity commands and (ii) an online system identification strategy for sim-to-real transfer leveraged from prior work. Videos of the robot's behaviors are available at: https://agility.csail.mit.edu/

研究动机与目标

  • 在草地、冰面和碎石等多样化自然地形上实现高速、全向运动。
  • 在将速度指令扩展至高速时,解决多任务强化学习中的训练不稳定性问题。
  • 在不依赖手工设计动力学模型的前提下,实现对敏捷运动的鲁棒、零样本仿真到现实迁移。
  • 通过端到端学习展示如跌倒恢复和电机故障补偿等涌现行为。
  • 在仅使用最少传感和可扩展策略学习的前提下,突破足式机器人的敏捷性极限。

提出的方法

  • 在仿真环境中使用鼓励高速、全向运动的奖励函数,训练端到端深度强化学习策略。
  • 采用自适应课程策略,根据物理可行性动态扩展速度指令集合,避免训练早期引入不切实际或过于困难的任务。
  • 利用在线系统辨识将仿真策略校准至真实世界动力学,实现零样本部署。
  • 策略仅观测本体感觉状态(关节角度、速度、IMU)和速度指令,不依赖视觉或地形几何信息。
  • 训练采用多任务强化学习设置,每个线速度与角速度的独立组合均被视为一个独立任务。
  • 采用教师-学生蒸馏策略以提升样本效率和泛化能力,但核心方法仍基于直接的端到端训练。
Figure 1 : An end-to-end learned controller enables the MIT Mini Cheetah to execute: (a) fast sprinting at $3.9\text{\,}\mathrm{m}\mathrm{/}\mathrm{s}$ (top); (b) a rough terrain $10$ -meter sprint at $3.4\text{\,}\mathrm{m}\mathrm{/}\mathrm{s}$ ; (c) high-speed spinning indoors; and (d) robust spin
Figure 1 : An end-to-end learned controller enables the MIT Mini Cheetah to execute: (a) fast sprinting at $3.9\text{\,}\mathrm{m}\mathrm{/}\mathrm{s}$ (top); (b) a rough terrain $10$ -meter sprint at $3.4\text{\,}\mathrm{m}\mathrm{/}\mathrm{s}$ ; (c) high-speed spinning indoors; and (d) robust spin

实验结果

研究问题

  • RQ1端到端强化学习策略是否能在无视觉或地形感知的前提下,实现在多样化自然地形上的高速运动?
  • RQ2如何自动调整课程学习以适应物理约束,从而稳定高速运动的训练过程?
  • RQ3在仅依赖本体感觉反馈的前提下,零样本仿真到现实迁移在多大程度上可实现?
  • RQ4在复杂、高速运动任务中,端到端学习会涌现出哪些行为?
  • RQ5与手工设计的模型预测控制器相比,学习得到的策略在敏捷性和鲁棒性方面表现如何?

主要发现

  • 控制器在平坦地面上实现了3.9 m/s的持续最高速度,创下MIT Mini Cheetah的新纪录。
  • 在不平坦的草地方案中,机器人在10米冲刺中平均速度达到3.4 m/s,展现出对地形不规则性的强鲁棒性。
  • 在平坦地面上实现了5.7 rad/s的高速旋转,且在冰面成功执行了旋转动作,表明具备强大的抗扰动能力。
  • 系统在真实部署中展现出如跌倒恢复和电机故障补偿等涌现行为。
  • 控制器实现了5.1的弗劳德数,为Mini Cheetah报告的最高值,尽管低于Cheetah 2的数值。
  • 在包括草地、冰面和碎石在内的多种地形上,零样本仿真到现实迁移均取得成功,无需任何现实世界微调。
Figure 2 : Our controller is a learned mapping from sensory inputs to desired joint positions. We parameterize it as 5-layer neural network $\pi_{\theta}$ with parameters $\theta$ optimized in simulation.
Figure 2 : Our controller is a learned mapping from sensory inputs to desired joint positions. We parameterize it as 5-layer neural network $\pi_{\theta}$ with parameters $\theta$ optimized in simulation.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。