[论文解读] Learning Multiple Gaits within Latent Space for Quadruped Robots
本文提出了一种端到端强化学习框架,通过使用由步态编码器和生成器共同训练的潜在空间,为四足机器人学习多种步态,实现了自适应、平滑的步态切换和用户可控的步态行为。该方法仅依赖本体感觉反馈,便在楼梯攀爬任务中实现了100%的成功率,在植被上的敏捷奔跑任务中实现了80%的成功率,其鲁棒性和适应性优于以往方法。
Learning multiple gaits is non-trivial for legged robots, especially when encountering different terrains and velocity commands. In this work, we present an end-to-end training framework for learning multiple gaits for quadruped robots, tailored to the needs of robust locomotion, agile locomotion, and user's commands. A latent space is constructed concurrently by a gait encoder and a gait generator, which helps the agent to reuse multiple gait skills to achieve adaptive gait behaviors. To learn natural behaviors for multiple gaits, we design gait-dependent rewards that are constructed explicitly from gait parameters and implicitly from conditional adversarial motion priors (CAMP). We demonstrate such multiple gaits control on a quadruped robot Go1 with only proprioceptive sensors.
研究动机与目标
- 使四足机器人能够根据用户指令学习并切换多种步态(例如:步行、快走、踱步、跳跃、跳跃奔跑)。
- 在复杂地形(如楼梯和不平坦的植被)上提升运动的鲁棒性和敏捷性,且不依赖视觉信息。
- 解决学习多样化、自然步态行为的挑战,同时保持实时控制和顺畅的过渡。
- 克服以往强化学习方法因奖励设计不佳或固定低层策略而导致的运动僵硬或泛化能力差的问题。
- 开发一个统一框架,整合步态相关奖励与条件对抗性运动先验(CAMP),以生成自然的步态。
提出的方法
- 采用非对称演员-评论家强化学习框架,端到端训练单一策略以实现多种步态行为。
- 通过步态编码器与步态生成器联合学习潜在空间 Z,实现不同步态技能之间的平滑插值与选择。
- 利用显式步态参数和隐式条件对抗性运动先验(CAMP)设计步态相关奖励,以引导自然运动的生成。
- CAMP组件使用条件判别器,确保生成的运动与多样化专家步态数据集的风格和动力学相匹配。
- 该框架仅基于本体感觉观测进行训练,无需外部传感器,从而实现实时硬件控制。
- 通过将技能表征(潜在空间)与任务特定策略适配相分离,避免了多步态学习中的任务冲突。
实验结果
研究问题
- RQ1单一端到端强化学习策略是否能够学习并切换多种步态,同时保持自然、平滑的运动和实时性能?
- RQ2协同学习的潜在空间在四足机器人运动中如何提升步态过渡的平滑性与技能可重用性?
- RQ3在无视觉信息的条件下,使用步态相关奖励与CAMP训练的策略在楼梯和植被等复杂地形上的泛化能力如何?
- RQ4与分层或教师-学生框架相比,该方法在复杂地形上的鲁棒性和敏捷性表现如何?
- RQ5系统是否能在仅依赖本体感觉反馈的前提下,实现高性能表现,同时支持用户对步态类型和速度的控制?
主要发现
- 所提方法在20 cm高、25 cm宽的台阶攀爬任务中实现了100%的成功率,优于基线方法。
- 在2.5 m/s的高速度下穿越植被地形的敏捷运动中,机器人实现了80%的成功率,显著优于MoB基线(20%)和先前基线(60%)。
- 自适应步态(C)在高台阶和陡坡上的表现优于分层方法(H),表明其低层策略具有更好的泛化能力。
- 由于连续潜在空间的存在,实现了平滑的步态过渡,能够在不同步态技能之间插值而无僵硬行为。
- 尽管基线方法采用了教师-学生框架,本方法在鲁棒和敏捷任务中均表现更优,这得益于非对称演员-评论家结构带来的更小的仿真到现实差距。
- 系统成功学习并执行了六种不同的步态——步行、快走、踱步、跳跃、跳跃奔跑和自适应步态——在用户指令下保持自然的运动风格。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。