[论文解读] Zero-Shot Terrain Generalization for Visual Locomotion Policies
本文提出一种基于多任务强化学习与程序化地形生成的端到端视觉运动策略,结合原始LiDAR输入,使四足机器人能够在13种不同地形(包括楼梯、崎岖地形及动态室内环境)中实现强大的零样本泛化能力,而无需依赖真值高度图或人工感知预处理。
Legged robots have unparalleled mobility on unstructured terrains. However, it remains an open challenge to design locomotion controllers that can operate in a large variety of environments. In this paper, we address this challenge of automatically learning locomotion controllers that can generalize to a diverse collection of terrains often encountered in the real world. We frame this challenge as a multi-task reinforcement learning problem and define each task as a type of terrain that the robot needs to traverse. We propose an end-to-end learning approach that makes direct use of the raw exteroceptive inputs gathered from a simulated 3D LiDAR sensor, thus circumventing the need for ground-truth heightmaps or preprocessing of perception information. As a result, the learned controller demonstrates excellent zero-shot generalization capabilities and can navigate 13 different environments, including stairs, rugged land, cluttered offices, and indoor spaces with humans.
研究动机与目标
- 解决为腿式机器人训练泛化能力以应对广泛非结构化地形而无需人工工程设计的挑战。
- 克服先前强化学习策略在未见环境中泛化能力差或需任务特定调优的局限性。
- 开发一种学习系统,使单一运动策略能在多样化、真实且此前未见过的地形中有效运行。
- 证明引入外感受感知(LiDAR)与轨迹调制策略架构可显著提升零样本泛化性能。
提出的方法
- 将腿式运动建模为多任务部分可观察马尔可夫决策过程(POMDP),其中每个任务对应一种特定地形类型。
- 设计一种程序化地形生成器,以高效生成多样化且逼真的训练环境,包括带有障碍物和动态元素的复杂室内外场景。
- 实现一种端到端的视觉运动策略,直接将原始LiDAR扫描数据与本体感觉状态映射为低层运动指令,绕过真值高度图预处理。
- 集成策略调制轨迹生成器(PMTG)框架,生成平滑、周期性且自适应的步态模式,以增强策略鲁棒性。
- 采用课程式任务分布的多任务强化学习方法进行策略训练,确保持续接触多样化地形类型。
- 使用高保真物理仿真器与视觉逼真的室内扫描数据,在训练和零样本测试场景中评估策略性能。
实验结果
研究问题
- RQ1通过多任务强化学习训练的单一运动策略是否能在无需微调的情况下泛化到广泛未见的地形?
- RQ2与反应式或仅依赖本体感觉的策略相比,引入原始外感受LiDAR输入对零样本泛化性能有何影响?
- RQ3与标准反应式控制策略相比,基于PMTG的策略架构在泛化能力和运动质量方面提升程度如何?
- RQ4采用多样化、程序化生成的地形进行多任务训练是否能防止灾难性遗忘,并带来优于顺序训练的泛化性能?
- RQ5所提出的视觉运动策略是否能成功导航复杂、杂乱且动态的室内环境(如存在移动人类的办公室)?
主要发现
- 所提出的视觉运动策略在未见过的崎岖山地地形上实现了67%的平均任务完成率,显著优于单地形策略(最高28%)。
- 采用多任务强化学习与程序化地形生成训练的策略在13种多样化环境中展现出强大的零样本泛化能力,包括楼梯、迷宫、森林及动态室内场景。
- 移除LiDAR输入会显著降低泛化性能,证实外感受感知在导航复杂几何变化地形中至关重要。
- 将基于PMTG的策略替换为反应式策略导致性能下降28%至218%,表明结构化步态生成可显著提升鲁棒性与泛化能力。
- 顺序训练(一次一个任务)导致灾难性遗忘且泛化能力差,证实并发多任务训练对有效策略迁移的必要性。
- 视觉-视觉运动策略生成更平滑、更具适应性的步态模式——例如在不平坦地形上调整脚部落点——从而实现在悬崖和崎岖路径等挑战性环境中的稳定导航。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。