Skip to main content
QUICK REVIEW

[论文解读] RL + Model-Based Control: Using On-Demand Optimal Control to Learn Versatile Legged Locomotion

Dong‐Ho Kang, Jin Cheng|arXiv (Cornell University)|May 29, 2023
Robotic Locomotion and Control被引用 1
一句话总结

本文提出了一种混合控制框架,将基于模型的最优控制(MBOC)与强化学习(RL)相结合,以实现多功能、鲁棒的足式运动。通过使用有限时域最优控制生成按需参考运动,并训练RL策略模仿这些运动,该方法在无需针对机器人设计奖励函数的情况下,实现了对复杂地形和多样化步态的高泛化能力,在粗糙环境中的表现优于模型预测控制。

ABSTRACT

This paper presents a control framework that combines model-based optimal control and reinforcement learning (RL) to achieve versatile and robust legged locomotion. Our approach enhances the RL training process by incorporating on-demand reference motions generated through finite-horizon optimal control, covering a broad range of velocities and gaits. These reference motions serve as targets for the RL policy to imitate, leading to the development of robust control policies that can be learned with reliability. Furthermore, by utilizing realistic simulation data that captures whole-body dynamics, RL effectively overcomes the inherent limitations in reference motions imposed by modeling simplifications. We validate the robustness and controllability of the RL training process within our framework through a series of experiments. In these experiments, our method showcases its capability to generalize reference motions and effectively handle more complex locomotion tasks that may pose challenges for the simplified model, thanks to RL's flexibility. Additionally, our framework effortlessly supports the training of control policies for robots with diverse dimensions, eliminating the necessity for robot-specific adjustments in the reward function and hyperparameters.

研究动机与目标

  • 克服纯基于模型的最优控制的局限性,后者依赖于简化假设,限制了其多功能性和适应性。
  • 解决标准RL在足式运动中面临的挑战,特别是对大量奖励塑形的需求以及缺乏行为先验。
  • 构建一个统一框架,利用MBOC在运动生成中的透明性和高效性,以及RL在策略学习中的灵活性和泛化能力。
  • 实现在无需机器人特定奖励函数或超参数调优的情况下,实现鲁棒的仿真到现实的迁移,并适应多种机器人形态。

提出的方法

  • 使用简化动力学模型(如VHIPM)的有限时域最优控制(OCP)生成按需参考运动,以覆盖广泛的运动速度和步态。
  • 通过精心设计的模仿奖励函数,训练RL策略以模仿这些MBOC生成的参考运动,该函数在保真度与泛化能力之间取得平衡。
  • 集成真实的仿真动力学(包括全身体动力学),使RL策略能够克服MBOC框架中固有的建模误差。
  • 在训练过程中应用广泛的随机化处理——包括地形摩擦、基于Perlin噪声的不规则地形、重力矢量扰动以及外部冲击——以增强鲁棒性并提升仿真到现实的迁移能力。
  • 采用接触相位参数化方法,支持非周期性和非对称步态,从而实现超越对称模式的多样化运动行为。
  • 在不同四足机器人(Go1和Aliengo)上复用相同的MBOC示范,实现无需重新调优奖励函数或超参数的迁移能力。

实验结果

研究问题

  • RQ1按需最优控制能否生成多样化且动力学一致的参考运动,作为RL模仿在足式运动中的有效目标?
  • RQ2RL策略在多大程度上能超越MBOC模型的简化假设,以应对复杂真实场景(如不规则地形和外部扰动)?
  • RQ3该混合框架在无需机器人特定奖励工程或超参数调优的情况下,能否实现鲁棒的仿真到现实迁移?
  • RQ4该框架能否支持多功能运动行为(包括非周期性和非对称步态),同时保持稳定性和可控性?
  • RQ5在复杂环境中,严格模仿MBOC运动与RL泛化所需灵活性之间存在何种权衡?

主要发现

  • RL策略成功将MBOC参考运动泛化至粗糙、不规则地形和倾斜表面,在10秒内完成5米行进任务的表现优于模型预测控制(MPC)基线。
  • 该策略保持了不同的步态风格,并能准确响应任意速度指令,而无需任务特定的奖励塑形或工程干预。
  • 在Unitree Go1和Aliengo四足机器人上的硬件实验验证了其在外部扰动、不规则地形和可变摩擦条件下的鲁棒性能。
  • 通过在训练期间系统性地随机化地形、摩擦、重力和外部冲击,该框架实现了有效的仿真到现实迁移,且无需进行机器人特定的奖励调整。
  • 该方法在保持多样化运动任务多功能性的同时,实现了可靠的训练过程和高性能策略(1640万次样本,64核CPU上耗时46小时)。
  • 该方法突破了周期性或对称步态的限制,通过接触相位参数化展示了实现类动物运动行为的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。