[论文解读] Learning Semantics-Aware Locomotion Skills from Human Demonstration
本论文提出了一种分层框架,仅使用40分钟的人类示范数据,即可为四足机器人学习语义感知的运动技能。通过结合预训练的语义感知、用于速度选择的模仿学习以及步态选择器,该系统实现了在复杂非结构化地形上的安全、高效穿越——在多种未见过的山地小径上实现了超过6公里的无故障导航。
The semantics of the environment, such as the terrain type and property, reveals important information for legged robots to adjust their behaviors. In this work, we present a framework that learns semantics-aware locomotion skills from perception for quadrupedal robots, such that the robot can traverse through complex offroad terrains with appropriate speeds and gaits using perception information. Due to the lack of high-fidelity outdoor simulation, our framework needs to be trained directly in the real world, which brings unique challenges in data efficiency and safety. To ensure sample efficiency, we pre-train the perception model with an off-road driving dataset. To avoid the risks of real-world policy exploration, we leverage human demonstration to train a speed policy that selects a desired forward speed from camera image. For maximum traversability, we pair the speed policy with a gait selector, which selects a robust locomotion gait for each forward speed. Using only 40 minutes of human demonstration data, our framework learns to adjust the speed and gait of the robot based on perceived terrain semantics, and enables the robot to walk over 6km without failure at close-to-optimal speed.
研究动机与目标
- 使腿式机器人能够基于地形语义(例如草地、泥地、沥青路)主动调整运动方式,而非仅依赖几何特征。
- 解决在非结构化地形环境中真实策略学习所面临的样本效率与安全性挑战,因数据成本高且硬件存在风险。
- 开发一种数据高效且安全的训练框架,避免在真实世界中直接进行强化学习探索。
- 通过联合学习速度与步态选择,提升在复杂地形中的可通行性与鲁棒性。
- 在极少量人类示范数据下,实现对未见过的非结构化地形的泛化能力。
提出的方法
- 在非结构化道路驾驶数据集上预训练语义分割网络,以提取用于地形理解的语义嵌入。
- 利用预训练网络的隐层表示对感知模型进行微调,以提升泛化能力与样本效率。
- 通过人类示范收集RGB图像中的速度选择数据,随后使用模仿学习训练速度策略,以选择合适的前进速度。
- 实施分层控制架构,使速度策略与步态选择器配对,为每个选定速度选择一种稳健的步态。
- 在Unitree A1机器人上部署端到端框架,实现实验室环境中的真实世界部署,无需仿真。
- 利用语义嵌入与模仿学习,实现在真实世界中极低探索量且高安全性的策略训练。
实验结果
研究问题
- RQ1四足机器人能否仅通过人类示范,根据语义地形类别学习调整其运动速度与步态?
- RQ2与仅依赖几何特征的方法相比,语义感知在非结构化非道路环境中的运动性能有何提升?
- RQ3结合预训练感知的模仿学习在多大程度上可减少数据需求并确保真实世界机器人学习的安全性?
- RQ4该框架能否泛化至未见过的地形,并在多样化户外小径上实现高速、无故障的穿越?
- RQ5不同的感知微调策略(例如使用隐层特征 vs. 类别预测)对策略性能有何影响?
主要发现
- 该框架成功使四足机器人在无需任何故障的情况下穿越了超过6公里的多样化、未见过的户外小径,展现出强大的泛化能力。
- 仅使用40分钟的人类示范数据,系统即可根据地形语义选择合适的速度与步态,在平坦坚硬表面(如沥青路)上实现高速运动。
- 该机器人在速度与安全性方面均优于制造商默认控制器,尤其在岩石与碎石等复杂地形上表现更优。
- 步态选择器显著提升了稳定性,相比仅使用步态的策略,其滑倒与故障次数大幅减少(后者在岩石地形上滑倒两次)。
- 消融实验表明,基于预训练隐层嵌入的微调策略能获得最准确的速度预测与最低的验证误差。
- 策略在坚硬平坦地形(如沥青路)上选择更快的速度,而在可变形或不平整地形(如草地、泥地)上选择更慢、更谨慎的步态,与人类直觉及地形物理特性一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。