[论文解读] Fast and Efficient Locomotion via Learned Gait Transitions
本文提出了一种分层强化学习框架,使四足机器人能够自主学习节能步态及跨速度的自然步态转换。通过使用进化策略训练高层步态策略,并结合低层凸模型预测控制(MPC)控制器,该系统能够以最小能耗实现步行、快走和飞驰步态之间的平稳过渡,在无需仿真到现实的微调情况下,成功实现在Unitree A1机器人上的稳健实际部署。
We focus on the problem of developing energy efficient controllers for quadrupedal robots. Animals can actively switch gaits at different speeds to lower their energy consumption. In this paper, we devise a hierarchical learning framework, in which distinctive locomotion gaits and natural gait transitions emerge automatically with a simple reward of energy minimization. We use evolutionary strategies (ES) to train a high-level gait policy that specifies gait patterns of each foot, while the low-level convex MPC controller optimizes the motor commands so that the robot can walk at a desired velocity using that gait pattern. We test our learning framework on a quadruped robot and demonstrate automatic gait transitions, from walking to trotting and to fly-trotting, as the robot increases its speed. We show that the learned hierarchical controller consumes much less energy across a wide range of locomotion speed than baseline controllers.
研究动机与目标
- 开发一种控制框架,使四足机器人能够学习节能的运动步态及转换,而无需手动设计步态。
- 解决端到端策略训练失败泛化到真实机器人的问题,这是由于存在仿真到现实的领域差距。
- 实现在不同速度下自动的步态转换,模仿生物四足动物的运动方式。
- 在无需额外微调或奖励塑形的情况下,实现所学策略在真实世界中的稳健部署。
- 通过将强化学习与最优控制的优势相结合,解耦步态生成与电机指令优化。
提出的方法
- 设计了一种分层框架,包含高层步态策略与低层凸MPC控制器,将步态模式定义与电机指令计算解耦。
- 高层步态策略使用进化策略(CMA-ES)进行训练,奖励函数基于速度跟踪与能量效率。
- 步态策略输出定义脚部触地时序的关键参数,MPC控制器据此实时计算最优电机指令。
- 低层MPC控制器使用简化的动力学模型,以确保实时可行性与鲁棒性,将接触力与接触序列视为隐式变量。
- 该框架完全在仿真中训练,并直接部署到真实的Unitree A1机器人上,无需额外数据收集或仿真到现实的适应过程。
- 观测空间包含IMU读数、电机角度与步态阶段,以提升策略性能,尤其对非ES算法有效。
实验结果
研究问题
- RQ1基于学习的框架是否能自动发现不同的步态及其自然转换,而无需手工设计的步态时序?
- RQ2与端到端策略相比,结合强化学习与最优控制的分层设计在样本效率与真实世界泛化方面有何改进?
- RQ3为何在该分层控制设置中,进化策略优于标准强化学习算法(如PPO与SAC)?
- RQ4在无需微调或领域随机化的情况下,仿真中训练的策略能在多大程度上直接部署到真实机器人上?
- RQ5该系统是否能在多种地形中实现高速运动(最高达2.5 m/s),同时保持低能耗与高稳定性?
主要发现
- 分层框架成功学习并部署了从步行到快走再到飞驰步态的步态转换,覆盖广泛的速率范围(0–2.5 m/s),模拟了生物四足动物的运动。
- CMA-ES训练的步态策略实现了0.84 ± 0.017的运输成本(CoT),在能量效率方面显著优于PPO、SAC与ARS。
- 该策略实现了0.0083 ± 0.00075的速度跟踪误差,表明在所有速度下均具有高精度的速度跟踪能力。
- 非分层基线方法(E2E与PMTG)未能学习到稳定的运动:E2E原地站立,PMTG仅使用三条腿,表明在平坦策略空间中收敛性差。
- 该系统直接部署在Unitree A1机器人上,在多种环境(地毯、草地、短障碍物)中均无需额外微调,证实了其强大的仿真到现实迁移能力。
- 进化策略(CMA-ES与ARS)显著优于PPO与SAC,尤其在原始观测空间中表现更优,表明MPC的黑箱特性使标准强化学习效果较差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。