Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning for Robust Parameterized Locomotion Control of Bipedal Robots

Zhongyu Li, Xuxin Cheng|arXiv (Cornell University)|Mar 26, 2021
Robotic Locomotion and Control参考文献 38被引用 12
一句话总结

该论文提出了一种无模型强化学习框架,通过基于混合零动态(HZD)的步态库,训练Cassie双足机器人稳健的参数化运动策略。通过在模拟环境中使用领域随机化和动力学变化进行训练,策略学习到了多样化、敏捷的步态——如变速度、变高度和转向——从而在无需重新训练的情况下,实现了对电机故障、外部扰动和环境变化的现实世界鲁棒性。

ABSTRACT

Developing robust walking controllers for bipedal robots is a challenging endeavor. Traditional model-based locomotion controllers require simplifying assumptions and careful modelling; any small errors can result in unstable control. To address these challenges for bipedal locomotion, we present a model-free reinforcement learning framework for training robust locomotion policies in simulation, which can then be transferred to a real bipedal Cassie robot. To facilitate sim-to-real transfer, domain randomization is used to encourage the policies to learn behaviors that are robust across variations in system dynamics. The learned policies enable Cassie to perform a set of diverse and dynamic behaviors, while also being more robust than traditional controllers and prior learning-based methods that use residual control. We demonstrate this on versatile walking behaviors such as tracking a target walking velocity, walking height, and turning yaw.

研究动机与目标

  • 开发一种稳健、多功能的双足机器人运动控制器,能够处理超越传统基于模型方法的多样化、动态行为。
  • 克服依赖预设参考控制器的残差控制方法的局限性,后者产生的步态有限且保守。
  • 提高在现实部署中对建模误差、环境变化和硬件故障(如电机损坏)的鲁棒性。
  • 实现端到端策略训练,直接模仿多样化HZD基础步态,提升行为多样性与稳定性。
  • 展示在模拟环境中通过领域随机化训练的策略成功迁移到真实世界Cassie机器人上的效果。

提出的方法

  • 使用基于混合零动态(HZD)的参数化运动步态库,为模仿学习提供多样化参考轨迹。
  • 采用无模型深度强化学习训练策略,直接模仿这些多样化步态,无需残差控制项。
  • 在训练过程中应用领域随机化,特别是随机化关节阻尼比及其他动力学参数,以增强鲁棒性。
  • 在模拟环境(MuJoCo)中训练策略,使其能够泛化至系统动力学和环境条件的变化。
  • 将训练好的策略直接部署到真实世界的Cassie机器人上,无需进一步调优,利用多样化训练数据带来的鲁棒性。
  • 采用奖励塑形方案,鼓励策略跟踪期望的行走速度、高度和偏航速率,同时保持稳定性。

实验结果

研究问题

  • RQ1在多样化HZD基础步态库上训练的无模型强化学习策略,是否能在仿真和真实世界部署中实现稳健的参数化运动?
  • RQ2通过领域随机化训练,能否提升对未建模动力学(如电机故障或摩擦变化)的鲁棒性?
  • RQ3与先前方法相比,摒弃残差控制而改用步态库进行模仿学习,是否能带来更好的性能和更广泛的可行指令集?
  • RQ4该策略是否能在不重新训练的情况下泛化至复杂行为,如转向、行走高度变化以及扰动后的恢复?
  • RQ5所学策略在现实世界鲁棒性方面,与基于模型的HZD控制器和残差控制基线相比,优势有多大?

主要发现

  • 所提出的策略成功控制真实世界的Cassie机器人,在无需重新训练的情况下实现了对可变行走速度、高度和偏航速率的跟踪。
  • 该策略在右腿两个电机损坏的情况下表现出鲁棒性,部署后立即保持稳定步态,无需调校。
  • 在仿真中,该策略在抗扰动能力方面优于非残差和残差基线方法,尤其在高强度干扰(β = 0.8, 1.0)下表现更优。
  • 与基于HZD的基线控制器相比,该策略在步态转换期间实现了更高的稳定性,扩大了可行指令集和安全集。
  • 该策略成功从正面、背面和侧向推力、意外负载施加以及地面摩擦变化中恢复。
  • 该方法实现了快速行走、侧向移动和转向等敏捷动态行为,这些行为在先前基于模型的控制器中难以可靠实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。