[论文解读] Extreme Parkour with Legged Robots
本文提出一种端到端强化学习方法,使低成本、低精度的腿式机器人仅依靠单个前向深度摄像头和单一神经网络策略,即可执行极端跑酷行为——如高跳、远跳、倒立和倾斜坡道穿越。关键贡献在于一种双重蒸馏方法,使策略能够自主从原始视觉输入预测行进方向,并直接生成精确的运动指令,从而在各种新颖的障碍课程中实现鲁棒的泛化能力。
Humans can perform parkour by traversing obstacles in a highly dynamic fashion requiring precise eye-muscle coordination and movement. Getting robots to do the same task requires overcoming similar challenges. Classically, this is done by independently engineering perception, actuation, and control systems to very low tolerances. This restricts them to tightly controlled settings such as a predetermined obstacle course in labs. In contrast, humans are able to learn parkour through practice without significantly changing their underlying biology. In this paper, we take a similar approach to developing robot parkour on a small low-cost robot with imprecise actuation and a single front-facing depth camera for perception which is low-frequency, jittery, and prone to artifacts. We show how a single neural net policy operating directly from a camera image, trained in simulation with large-scale RL, can overcome imprecise sensing and actuation to output highly precise control behavior end-to-end. We show our robot can perform a high jump on obstacles 2x its height, long jump across gaps 2x its length, do a handstand and run across tilted ramps, and generalize to novel obstacle courses with different physical properties. Parkour videos at https://extreme-parkour.github.io/
研究动机与目标
- 在执行机构精度不足和感知质量较低的实际约束条件下,使腿式机器人能够执行极端跑酷行为。
- 克服传统手工设计控制流程的局限性,后者需要精确的障碍物地图和预规划。
- 开发单一神经网络策略,使其能够在无需显式任务规划的情况下泛化于多样化的跑酷任务(如跳跃、倒立、斜坡)中。
- 仅通过视觉输入实现动态动作中的自主方向调整,消除对外部方向信号的依赖。
- 证明端到端强化学习结合统一奖励设计,即使在传感器和执行器存在噪声的情况下,仍能涌现出高精度行为。
提出的方法
- 采用两阶段强化学习框架:第一阶段使用带有特权方向信息的策略进行训练(阶段1),第二阶段通过蒸馏使策略直接从深度图像中预测方向(阶段2)。
- 提出一种基于内积的新型奖励函数,通过鼓励机器人基座速度与期望方向对齐,统一多种跑酷行为的运动获取。
- 将教师策略的运动指令和方向预测能力同时蒸馏到学生策略中,实现仅从原始视觉输入进行自主决策。
- 在大规模强化学习的仿真环境中训练策略,覆盖多种障碍物课程,包括跨栏、缝隙、台阶和倾斜坡道。
- 在奖励函数中引入清空惩罚,以减少在边缘附近不安全的脚部放置行为,提升稳定性。
- 在无外感受反馈(即无外部方向输入)的条件下训练倒立策略,完全依赖本体感觉和视觉反馈。
实验结果
研究问题
- RQ1通过端到端强化学习训练的单一神经网络策略,是否能够在低成本机器人上实现极端跑酷行为,即使其执行机构精度不足且感知质量较低?
- RQ2在仿真中训练的策略是否能泛化到具有不同物理属性和几何结构的新型、未见过的障碍课程?
- RQ3策略是否能仅从原始深度图像中自主预测方向,而无需外部监督,从而实现长跳、倒立等高精度动作?
- RQ4基于内积的统一奖励函数与任务特定或手工设计的奖励相比,在支持多样化跑酷行为方面表现如何?
- RQ5在未显式提供外感受反馈(如偏航方向)的条件下训练的策略,是否仍能在倒立等动态任务中实现鲁棒性能?
主要发现
- 所提方法在所有仿真地形上的平均x位移(MXD)达到98%,优于基线方法NoDir和NoClear,后者因分布偏移而无法收敛。
- 在真实世界测试中,策略的MXD为0.92 ± 0.19,MEV为0.09 ± 0.33,接近具备完美方向输入的“理想策略”(MXD为0.94 ± 0.19)。
- 在各类地形中最困难的实例中,策略的成功率比基线高出20%至80%,尤其在缝隙和倾斜坡道上表现优异,而人类提供方向信号的基线方法在此类场景中失效。
- 无外感受反馈训练的倒立策略成功在多种地形(包括楼梯)上行走,仅依赖本体感觉和视觉反馈即展现出强大鲁棒性。
- 双重蒸馏方法使策略能够从深度图像中准确预测方向,从而在跳跃和奔跑过程中动态调整轨迹。
- 内积奖励设计促使涌现出高精度行为,如跃过两倍于机器人自身高度的障碍物的高跳,以及跨越两倍于其长度缝隙的远跳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。