Skip to main content
QUICK REVIEW

[论文解读] RMA: Rapid Motor Adaptation for Legged Robots

Ashish Kumar, Zipeng Fu|arXiv (Cornell University)|Jul 8, 2021
Robotic Locomotion and Control参考文献 58被引用 16
一句话总结

RMA 是一种用于四足机器人的两阶段强化学习框架,通过在仿真中训练的基策略和快速适应模块,实现在未见过地形上的实时适应。它在沙地、泥地和植被地形上实现了100%的成功率,在光滑表面上实现了90%的成功率,且无需在真实世界中微调,展示了在低成本硬件(如Unitree A1机器人)上具备鲁棒性的在线运动适应能力。

ABSTRACT

Successful real-world deployment of legged robots would require them to adapt in real-time to unseen scenarios like changing terrains, changing payloads, wear and tear. This paper presents Rapid Motor Adaptation (RMA) algorithm to solve this problem of real-time online adaptation in quadruped robots. RMA consists of two components: a base policy and an adaptation module. The combination of these components enables the robot to adapt to novel situations in fractions of a second. RMA is trained completely in simulation without using any domain knowledge like reference trajectories or predefined foot trajectory generators and is deployed on the A1 robot without any fine-tuning. We train RMA on a varied terrain generator using bioenergetics-inspired rewards and deploy it on a variety of difficult terrains including rocky, slippery, deformable surfaces in environments with grass, long vegetation, concrete, pebbles, stairs, sand, etc. RMA shows state-of-the-art performance across diverse real-world as well as simulation experiments. Video results at https://ashish-kmr.github.io/rma-legged-robots/

研究动机与目标

  • 实现足式机器人在无先前真实世界经验或微调的情况下,对沙地、泥地和台阶等未见过的真实世界地形实现实时快速适应。
  • 通过仅使用本体感觉反馈和特权环境信号,在仿真中训练整个适应系统,以弥合仿真到现实的泛化差距。
  • 开发一种计算高效、异步的控制架构,实现在计算能力有限的低成本机器人上的实时适应。
  • 证明无需显式系统辨识或预设运动模板,仅通过端到端学习外部状态表征,即可实现在线适应。
  • 在包括岩石、光滑和可变形表面在内的复杂户外地形上验证该方法的有效性,这些地形常导致传统方法失效。

提出的方法

  • RMA 框架由基策略 π 和适应模块 φ 组成,分两个阶段训练:首先,π 在仿真中使用无模型强化学习进行训练,可访问特权环境因子 et。
  • 环境因子 et 通过专用编码器 μ 编码为潜在外部状态向量 zt,使基策略能够根据地形特性条件化其动作。
  • 在第二阶段,适应模块 φ 通过监督学习在在线策略数据上进行训练,以从状态和动作的历史中预测外部状态向量 ẑt,从而实现实时地形特性估计。
  • 在部署时,适应模块以10Hz运行以预测 ẑt,该预测结果被输入至以100Hz运行的基策略,后者通过PD控制器生成关节位置指令。
  • 异步设计使基策略能够使用最新预测的 ẑt,最小化延迟,实现在低算力平台上的实时适应。
  • 训练过程中采用受生物能量学启发的奖励机制,以鼓励在包括可变形和不平整表面在内的多样化地形上实现节能运动。

实验结果

研究问题

  • RQ1足式机器人是否能在无先前真实世界经验或微调的情况下,实现实时适应未见过的地形(如沙地、泥地和台阶)?
  • RQ2完全在仿真中训练的策略是否能泛化到具有显著物理差异(包括接触动力学和可变形性)的真实世界地形?
  • RQ3仅使用本体感觉反馈和学习到的外部状态估计,是否能够实现快速适应,而无需显式系统辨识或运动模板?
  • RQ4适应模块在检测和响应突发地形变化(如光滑区域或脚部缠绕)方面有多有效?
  • RQ5轻量级、异步控制架构是否能够在计算能力有限的低成本机器人上实现实时适应?

主要发现

  • RMA 在沙地、泥地和泥土地形上实现了100%的成功率,表明其对运动过程中脚部下陷和卡滞具有强鲁棒性。
  • 机器人在100%的试验中成功穿越了高大的植被和灌木障碍物,表明其对周期性不稳和脚部缠绕具有有效适应能力。
  • 在徒步小径上遇到的台阶中,尽管从未在训练中接触过台阶,RMA 仍实现了70%的成功率,展现出强大的零样本泛化能力。
  • 在下坡穿越泥浆堆的试验中,机器人成功率达到100%;在穿越水泥块堆和碎石堆的陡坡试验中,成功率为80%,凸显其在复杂不稳定表面的性能表现。
  • 在光滑表面(涂抹油)的试验中,RMA 实现了90%的成功率,适应模块检测到打滑并相应调整步态和扭矩配置。
  • 消融研究显示,移除适应模块后性能显著下降,证实其在实时地形适应中起着关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。