[论文解读] GLiDE: Generalizable Quadrupedal Locomotion in Diverse Environments with a Centroidal Model
GLiDE 提出了一种基于简化质心动力学模型的强化学习框架,用于四足运动控制,其中动作定义为身体的线加速度和角加速度,通过二次规划(QP)计算地面反作用力。该方法在多种地形(包括平坦地面、踏脚石、平衡木以及双足平衡)上实现了鲁棒且可泛化的运动,成功实现了端到端的仿真到现实世界的迁移,采用极简的奖励函数并显著降低了计算成本,相较于全身体动力学模型具有优势。
Model-free reinforcement learning (RL) for legged locomotion commonly relies on a physics simulator that can accurately predict the behaviors of every degree of freedom of the robot. In contrast, approximate reduced-order models are commonly used for many model predictive control strategies. In this work we abandon the conventional use of high-fidelity dynamics models in RL and we instead seek to understand what can be achieved when using RL with a much simpler centroidal model when applied to quadrupedal locomotion. We show that RL-based control of the accelerations of a centroidal model is surprisingly effective, when combined with a quadratic program to realize the commanded actions via ground contact forces. It allows for a simple reward structure, reduced computational costs, and robust sim-to-real transfer. We show the generality of the method by demonstrating flat-terrain gaits, stepping-stone locomotion, two-legged in-place balance, balance beam locomotion, and direct sim-to-real transfer.
研究动机与目标
- 探究是否可以使用高度简化的质心动力学模型进行强化学习,实现无需依赖高保真全身体动力学仿真即可获得鲁棒且可泛化的四足运动。
- 通过将控制与全关节级动力学解耦,降低基于强化学习的腿式运动控制中的奖励设计复杂度与计算成本。
- 实现对多样化运动任务(包括具有挑战性的平衡与不平坦地形场景)的有效仿真到现实迁移与泛化。
- 证明基于简单动作空间与QP力求解的质心模型,可在鲁棒性与泛化能力方面超越传统MPC与全模型强化学习方法。
- 为四足控制提供一种实用且高效的全模型强化学习替代方案,支持多种步态与地形类型。
提出的方法
- 该方法采用质心动力学模型,将机器人表示为带有虚拟腿的刚体,控制动作以身体的线加速度与角加速度形式指定。
- 通过二次规划(QP)计算地面反作用力(GRFs),并施加无滑移与腿长等约束,将质心指令转化为可行的接触力。
- 通过雅可比转置方法推导支撑腿的关节力矩,而摆动腿则采用轨迹跟踪控制,从而实现仅通过质心策略完成全机器人驱动。
- 采用简单六项式奖励函数,聚焦于前进、稳定与平衡等任务目标,避免全模型强化学习中复杂的奖励塑造。
- 在仿真环境中使用Laikago与A1机器人,通过无模型强化学习进行策略训练,足部位置由启发式函数确定。
- 该框架支持直接的仿真到现实迁移,已在真实A1机器人上验证,展示了在多样化环境中的鲁棒性。
实验结果
研究问题
- RQ1基于质心模型的强化学习是否能在无需高保真全身体动力学仿真下,实现跨多样化地形的鲁棒且可泛化的四足运动?
- RQ2与全模型强化学习及传统MPC相比,基于质心模型的强化学习方法在奖励效率、计算成本与泛化能力方面表现如何?
- RQ3简单奖励函数与QP力求解在多大程度上可实现如双足平衡与踏脚石穿越等复杂行为?
- RQ4质心模型在捕捉真实世界动力学方面的局限性是什么,这些局限性如何影响仿真到现实的迁移?
- RQ5是否可以学习到一个统一策略,使其在多种运动任务(包括平坦地形、平衡木与不平整表面)上均具有泛化能力?
主要发现
- GLiDE 在真实A1机器人上成功实现仿真到现实的迁移,展示了在多样化环境中的鲁棒运动能力,无需领域随机化或大量仿真到现实的适应调整。
- 该方法在平坦地面与踏脚石任务上仅需1–2小时训练,远快于全模型强化学习(如DeepGait需58小时),且仅使用六项奖励项。
- GLiDE策略的高频运动成分更低(10 Hz以上能量占比13%),相比关节力矩强化学习(68%),表明其步态更平滑、更稳定。
- GLiDE在稳定性与泛化能力方面优于基于质心的PD控制器,尤其在平衡木与双足平衡任务中表现更优,而PD控制器因欠驱动问题而失败。
- GLiDE-full变体在与测试环境相同的环境中训练,其性能在多数场景下与GLiDE几乎完全一致,证实质心模型足以实现高性能。
- 该方法在步态与地形之间具有良好的泛化能力,仅通过单一框架即可成功处理平坦行走、快走、踏脚石、平衡木穿越及双足平衡等任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。