[论文解读] Robust and Versatile Bipedal Jumping Control through Reinforcement Learning
本文提出了一种强化学习框架,使扭矩控制的双足机器人Cassie能够在真实世界中实现鲁棒且多样的动态跳跃。通过使用一种新型的长短期输入/输出历史编码器,并结合多阶段训练方案,机器人能够学习跳跃至多种目标——如不同距离、方向和高处平台——并实现了高成功率,同时在受到扰动时展现出自发的恢复行为。
This work aims to push the limits of agility for bipedal robots by enabling a torque-controlled bipedal robot to perform robust and versatile dynamic jumps in the real world. We present a reinforcement learning framework for training a robot to accomplish a large variety of jumping tasks, such as jumping to different locations and directions. To improve performance on these challenging tasks, we develop a new policy structure that encodes the robot's long-term input/output (I/O) history while also providing direct access to a short-term I/O history. In order to train a versatile jumping policy, we utilize a multi-stage training scheme that includes different training stages for different objectives. After multi-stage training, the policy can be directly transferred to a real bipedal Cassie robot. Training on different tasks and exploring more diverse scenarios lead to highly robust policies that can exploit the diverse set of learned maneuvers to recover from perturbations or poor landings during real-world deployment. Such robustness in the proposed policy enables Cassie to succeed in completing a variety of challenging jump tasks in the real world, such as standing long jumps, jumping onto elevated platforms, and multi-axes jumps.
研究动机与目标
- 使一台全尺寸、扭矩控制的双足机器人在真实世界中实现敏捷的动态跳跃,克服以往基于模型和单任务强化学习方法的局限性。
- 解决双足跳跃中复杂混合动力学的控制挑战,包括在数秒内完成起跳、飞行和高冲击着陆。
- 开发一种目标条件化的策略,使其在多种跳跃任务(如前向、侧向、转向、高处跳跃)之间具备泛化能力,以增强鲁棒性和适应性。
- 通过在广泛多样的跳跃任务上进行训练,而非仅依赖动力学随机化,来提升仿真到现实的迁移能力与鲁棒性。
- 证明训练中的多样性可导致在真实部署中涌现出恢复行为,例如在着陆不佳后切换为跳跃动作。
提出的方法
- 提出一种新型策略架构,采用双编码器结构:长期输入/输出历史编码器用于捕捉过往轨迹,短期编码器用于即时反馈,两者与策略联合训练。
- 实施一种多阶段训练方案,将复杂的多目标跳跃问题分解为三个子问题:(1) 学习基础跳跃动作,(2) 学习多样化跳跃目标,(3) 针对鲁棒性和泛化能力进行微调。
- 采用目标条件化的强化学习,训练单一策略,将状态和目标(如目标位置、朝向)映射为扭矩指令,实现对新目标的零样本部署。
- 集成一种时间编码器,能够从机器人自身的输入/输出历史中学习提取相关信息(如冲击力和接触转换),而无需依赖预设的环境参数。
- 通过在高保真MuJoCo仿真环境中进行训练,随机化动力学和目标分布,实现仿真到现实的迁移,随后直接部署到真实的Cassie机器人上。
- 应用课程学习和基于课程的目标调度,逐步增加训练过程中的任务多样性与难度,提升样本效率和策略泛化能力。
实验结果
研究问题
- RQ1一个单一的目标条件化强化学习策略是否能够使扭矩控制的双足机器人在真实世界中实现多种动态跳跃,包括跳向不同位置、方向和高度?
- RQ2同时学习多个跳跃任务的多目标训练方式,在真实部署中(尤其是在受到扰动或着陆不佳时)如何影响策略的鲁棒性?
- RQ3将长期和短期输入/输出历史整合到策略架构中,在复杂高冲击跳跃任务上的学习效率和性能方面,能带来多大程度的提升?
- RQ4在包含多样化目标的仿真环境中训练的策略,是否能够无需微调直接泛化到真实世界?任务多样性在这一仿真到现实迁移过程中起到什么作用?
- RQ5在多种跳跃任务上进行训练是否会催生出未显式编程的恢复行为,例如在跳跃失败后自动切换为跳跃动作?
主要发现
- 所提方法在真实Cassie机器人上实现了最大前向跳跃距离1.4米,显著优于以往仅达到约0.5米的工作。
- 机器人成功完成了站立式远跳(最远达1.4米前向)、侧向跳跃(±0.3米)、转向跳跃(±55°)以及跳上高0.44米平台的动作,展现出高度的多样性。
- 该策略在仿真中对多样化跳跃任务的成功率达到90%,在真实世界部署中保持超过80%的成功率,表明其具备强大的仿真到现实迁移能力。
- 鲁棒性源于多目标训练:策略在遭受大冲击着陆或外部扰动时,可通过切换至其他已学习的动作(如跳跃)实现恢复,而无需重新规划。
- 消融实验表明,与单任务训练(无论是否包含动力学随机化)相比,多目标训练显著提升了鲁棒性,即使在增加扰动条件下也表现更优。
- 双编码器架构(长期与短期输入/输出历史)优于以往方法(如RMA/TS),后者需要独立的师生训练和微调,而本方法能更灵活、直接地利用历史输入/输出数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。