Skip to main content
QUICK REVIEW

[论文解读] GenLoco: Generalized Locomotion Controllers for Quadrupedal Robots

Gilbert Feng, Hongbo Zhang|arXiv (Cornell University)|Sep 12, 2022
Robotic Locomotion and Control被引用 17
一句话总结

该论文提出 GenLoco,一种通过在仿真中随机化机器人形态来训练四足机器人通用运动控制策略的强化学习框架。通过在一系列形态各异的程序化生成四足机器人(包括不同尺寸、质量与腿长)上进行训练,所得到的策略实现了对未见过的真实四足机器人(如 Unitree A1、MIT Mini Cheetah 和 CUHK Sirius)的零样本迁移,其在仿真与真实世界部署中均优于机器人专用策略。

ABSTRACT

Recent years have seen a surge in commercially-available and affordable quadrupedal robots, with many of these platforms being actively used in research and industry. As the availability of legged robots grows, so does the need for controllers that enable these robots to perform useful skills. However, most learning-based frameworks for controller development focus on training robot-specific controllers, a process that needs to be repeated for every new robot. In this work, we introduce a framework for training generalized locomotion (GenLoco) controllers for quadrupedal robots. Our framework synthesizes general-purpose locomotion controllers that can be deployed on a large variety of quadrupedal robots with similar morphologies. We present a simple but effective morphology randomization method that procedurally generates a diverse set of simulated robots for training. We show that by training a controller on this large set of simulated robots, our models acquire more general control strategies that can be directly transferred to novel simulated and real-world robots with diverse morphologies, which were not observed during training.

研究动机与目标

  • 为解决为每个新型四足机器人平台训练专用运动控制策略所带来的高昂成本。
  • 实现可迁移的、通用的运动控制策略,使其适用于具有不同形态与动力学特性的机器人。
  • 通过在策略学习过程中引入多样化形态的训练,降低对精确仿真到现实世界(sim-to-real)迁移的依赖。
  • 证明单一策略可在无需微调的情况下直接部署于多种真实世界的四足机器人上。
  • 为新型四足机器人提供可复用、开源的基线模型,避免高昂的再训练成本。

提出的方法

  • 通过在形态模板内随机化机体尺寸、腿长与质量,程序化生成多样化的仿真四足机器人。
  • 在这一系列形态多样的仿真机器人上训练基于历史的深度强化学习策略,以学习通用控制策略。
  • 在训练过程中应用形态随机化,使策略暴露于广泛的运动学与动力学差异中。
  • 在所有仿真形态中使用单一策略头并共享参数,以促进策略泛化。
  • 通过在训练中未见过的真实机器人上进行零样本部署,评估策略的迁移性能。
  • 在所有仿真机器人中保持固定的自由度(DoFs)与连杆结构,以确保架构一致性。

实验结果

研究问题

  • RQ1是否可以训练出一个单一的运动控制策略,使其在形态各异的四足机器人上均具有泛化能力?
  • RQ2与仅在单一机器人上训练相比,在训练过程中引入形态随机化是否能提升仿真到现实世界的迁移性能?
  • RQ3是否可以将仅在仿真机器人上训练的策略直接部署到真实世界机器人上而无需微调?
  • RQ4在真实世界部署中,通用策略的性能与机器人专用策略相比如何?
  • RQ5形态随机化在多大程度上提升了对分布外动力学变化的鲁棒性?

主要发现

  • 在快走步态下,GenLoco 策略在 Unitree A1 上获得 0.773 ± 0.054 的归一化回报,在 Mini Cheetah 上获得 0.743 ± 0.092,优于 A1 专用策略(0.696 ± 0.032)和 Cheetah 专用策略(6 次试验中为 0)。
  • 在旋转步态下,GenLoco 在 A1 上获得 0.670 ± 0.070,在 Cheetah 上获得 0.721 ± 0.090,优于 A1 专用策略(0.572 ± 0.049)和 Cheetah 专用策略(0.258 ± 0.013)。
  • 尽管 Mini Cheetah 专用策略在仿真中表现良好,但在 6 次真实世界试验中全部失败,而 GenLoco 策略始终成功,表明其具备更优的仿真到现实世界迁移鲁棒性。
  • GenLoco 策略对电机摩擦与驱动力变化表现出显著鲁棒性,表明其对分布外动力学变化具有良好的泛化能力。
  • 在新开发的 CUHK Sirius 机器人上,仅在硬件可用数天内即完成部署,证实了其零样本迁移能力。
  • 在更大尺寸的机器人上观察到性能下降,表明在极端形态差异下,泛化能力存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。