[论文解读] Learning multiple gaits of quadruped robot using hierarchical reinforcement learning
本文提出了一种用于四足机器人的分层强化学习控制器,该控制器基于速度指令学习多种步态(快走、快跑、跳跃),采用两级策略:由中央模式发生器(CPG)负责步态选择与周期调制,由局部反馈控制器负责关节跟踪。该方法在不同速度范围内实现了节能的运动表现,优于仅采用单一策略的强化学习方法,后者无论速度如何都默认采用一种步态。
There is a growing interest in learning a velocity command tracking controller of quadruped robot using reinforcement learning due to its robustness and scalability. However, a single policy, trained end-to-end, usually shows a single gait regardless of the command velocity. This could be a suboptimal solution considering the existence of optimal gait according to the velocity for quadruped animals. In this work, we propose a hierarchical controller for quadruped robot that could generate multiple gaits (i.e. pace, trot, bound) while tracking velocity command. Our controller is composed of two policies, each working as a central pattern generator and local feedback controller, and trained with hierarchical reinforcement learning. Experiment results show 1) the existence of optimal gait for specific velocity range 2) the efficiency of our hierarchical controller compared to a controller composed of a single policy, which usually shows a single gait. Codes are publicly available.
研究动机与目标
- 解决单一策略强化学习的局限性,后者通常无论速度指令如何都仅学习一种步态。
- 使四足机器人能够根据期望速度自主选择并切换多种步态(快走、快跑、跳跃)。
- 通过结合基于CPG的步态规划与局部反馈的分层控制,提升能量效率与速度跟踪性能。
- 证明最优步态选择随速度变化而变化,这与生物四足动物的行为一致。
- 提供一种可扩展、鲁棒的多步态运动框架,无需依赖参考运动数据或启发式奖励设计。
提出的方法
- 控制器采用两级分层结构:高层CPG策略用于步态选择与周期调制,低层反馈策略用于关节力矩控制。
- 高层策略输出CPG相位与周期信号,用于在四条腿上生成周期性步态模式。
- 低层策略利用CPG信号与实时足部接触/环境反馈,通过PD控制与局部反馈计算关节力矩。
- 采用课程学习策略,在训练过程中逐步增加速度指令范围,以提升策略泛化能力。
- 奖励函数结合了多个成本项:速度跟踪误差(角速度与线速度)、力矩努力、关节速度、足部离地高度、打滑、姿态、平滑性以及腿部相位一致性。
- CPG信号设计支持相位偏移与周期调制,从而实现步态之间的平滑过渡,但过渡期间的突变相位变化会降低跟踪性能。
实验结果
研究问题
- RQ1强化学习控制器能否根据不同的速度指令学习并执行多种不同的步态(快走、快跑、跳跃)?
- RQ2采用基于CPG的高层策略的分层控制,是否相比单一策略的端到端方法,能实现更好的能量效率与步态适应性?
- RQ3在速度跟踪误差与能耗方面,多步态控制器相较于单步态基线的表现如何?
- RQ4CPG相位与周期在实现平滑步态过渡与自适应运动中起到什么作用?
- RQ5控制器能否根据速度学习最优步态选择,从而模仿生物四足动物的行为?
主要发现
- 所提出的分层控制器成功在不同速度范围内学习并执行了多种步态(快走、快跑、跳跃),展示了自适应步态选择能力。
- 在特定速度范围内,该控制器的能耗低于单策略基线,表明其效率更高。
- 单策略基线无论速度指令如何,均收敛至单一步态(快走),导致运动不自然且性能欠佳。
- 由于步态切换期间CPG相位发生突变,多步态控制器的速度跟踪误差较高,表明需要更平滑的相位处理机制。
- 基于CPG的控制器对接触干扰表现出鲁棒性,并在不同步态间保持了稳定的运动表现,接触与CPG信号图证实了这一点。
- 成本函数设计(包括足部离地高度、打滑与平滑性项)有助于实现稳定且安全的运动,最大限度减少足部打滑并保持最优离地高度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。