Skip to main content
QUICK REVIEW

[论文解读] Zero-shot Imitation Learning from Demonstrations for Legged Robot Visual Navigation

Xinlei Pan, Tingnan Zhang|arXiv (Cornell University)|Sep 27, 2019
Human Pose and Action Recognition参考文献 42被引用 5
一句话总结

本文提出了一种零样本模仿学习框架,通过第三人称视角的人类示范训练足式机器人的视觉导航策略,利用特征解耦网络(FDN)克服视角差异,并通过图形用户界面(GUI)或逆动力学模型实现动作标注。该方法在存在视角差异的情况下,实现了接近最优策略的导航成功率,展示了在仿真和真实世界环境中有效的泛化能力。

ABSTRACT

Imitation learning is a popular approach for training visual navigation policies. However, collecting expert demonstrations for legged robots is challenging as these robots can be hard to control, move slowly, and cannot operate continuously for a long time. Here, we propose a zero-shot imitation learning approach for training a visual navigation policy on legged robots from human (third-person perspective) demonstrations, enabling high-quality navigation and cost-effective data collection. However, imitation learning from third-person demonstrations raises unique challenges. First, these demonstrations are captured from different camera perspectives, which we address via a feature disentanglement network (FDN) that extracts perspective-invariant state features. Second, as transition dynamics vary across systems, we label missing actions by either building an inverse model of the robot's dynamics in the feature space and applying it to the human demonstrations or developing a Graphic User Interface(GUI) to label human demonstrations. To train a navigation policy we use a model-based imitation learning approach with FDN and labeled human demonstrations. We show that our framework can learn an effective policy for a legged robot, Laikago, from human demonstrations in both simulated and real-world environments. Our approach is zero-shot as the robot never navigates the same paths during training as those at testing time. We justify our framework by performing a comparative study.

研究动机与目标

  • 解决由于硬件限制和难以持续运行,导致足式机器人大规模导航数据收集的挑战。
  • 克服人类示范者与足式机器人在视觉导航任务中因视角差异导致的领域分布偏移问题。
  • 通过在训练过程中不包含测试轨迹,实现零样本泛化,训练导航策略。
  • 开发一种可扩展的方法,利用图形用户界面(GUI)或学习到的逆动力学模型,将人类示范标注为机器人兼容的动作。
  • 在仿真和真实世界环境中验证该框架在目标驱动视觉导航任务中的有效性。

提出的方法

  • 采用特征解耦网络(FDN),利用循环一致性损失将视角不变的状态特征与视角相关特征分离。
  • 训练FDN以从解耦特征中重建输入图像,确保提取的特征对视角变化具有鲁棒性。
  • 通过自定义GUI或学习逆动力学模型,将图像对映射到潜在特征空间中的机器人动作,实现人类示范动作的标注。
  • 采用基于模型的模仿学习方法,在解耦的潜在特征空间中训练导航策略,实现在未见目标上的零样本泛化。
  • 将该框架应用于Laikago足式机器人,在仿真环境(NavWorld、OfficeWorld)和真实世界环境中进行测试,以目标图像作为输入。
  • 通过对比视角变化下的生成图像与真实图像,验证FDN的图像重建质量。

实验结果

研究问题

  • RQ1特征解耦网络能否有效从第三人称视角的人类示范中提取用于足式机器人导航的视角不变特征?
  • RQ2当机器人在训练期间从未导航过相同路径时,所提出的框架在未见测试任务上的泛化能力如何?
  • RQ3人类示范者与机器人之间的视角差异对性能有何影响?是否能被有效缓解?
  • RQ4基于GUI的动作标注与学习到的逆动力学模型在可扩展性和准确性方面有何对比?
  • RQ5在存在领域偏移和数据有限的情况下,该框架在导航成功率上能否实现接近最优策略的性能?

主要发现

  • 所提出的框架在NavWorld和OfficeWorld中均实现了接近最优策略模仿学习(UPN)的导航成功率,即使存在显著的视角差异。
  • 在存在视角差异的情况下,基线方法UPN-PerspChange无法泛化,而所提方法保持了强性能,证明了FDN在处理领域偏移方面的有效性。
  • FDN在视角变化下成功重建了图像,验证了其解耦视角不变特征的能力。
  • 对比研究显示,所提方法在视角差异下优于UPN-PerspChange,表明当视角不同时,直接策略迁移会失败。
  • OfficeWorld中的成功率高于NavWorld,原因是其动作空间更简单(90°转向 vs. 30°转向),证实任务复杂度影响泛化性能。
  • 手动GUI动作标注在真实世界部署中仍是瓶颈,尽管逆动力学模型在仿真中表现良好,但在真实机器人上因图像模糊和离散动作不匹配而失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。