Skip to main content
QUICK REVIEW

[论文解读] Learning Navigation Subroutines from Egocentric Videos

Ashish Kumar, Saurabh Gupta|arXiv (Cornell University)|May 29, 2019
Robotic Path Planning Algorithms参考文献 47被引用 10
一句话总结

该论文提出一种自监督方法,通过在极少交互数据上使用逆动力学模型对动作进行伪标签,从第一人称视频中学习视觉-运动子程序,然后将轨迹聚类为离散子程序。该方法实现了样本高效的分层强化学习导航,训练速度相比基线方法最快提升4倍,且优于在200倍更多数据上训练的方法。

ABSTRACT

Planning at a higher level of abstraction instead of low level torques improves the sample efficiency in reinforcement learning, and computational efficiency in classical planning. We propose a method to learn such hierarchical abstractions, or subroutines from egocentric video data of experts performing tasks. We learn a self-supervised inverse model on small amounts of random interaction data to pseudo-label the expert egocentric videos with agent actions. Visuomotor subroutines are acquired from these pseudo-labeled videos by learning a latent intent-conditioned policy that predicts the inferred pseudo-actions from the corresponding image observations. We demonstrate our proposed approach in context of navigation, and show that we can successfully learn consistent and diverse visuomotor subroutines from passive egocentric videos. We demonstrate the utility of our acquired visuomotor subroutines by using them as is for exploration, and as sub-policies in a hierarchical RL framework for reaching point goals and semantic goals. We also demonstrate behavior of our subroutines in the real world, by deploying them on a real robotic platform. Project website: https://ashishkumar1993.github.io/subroutines/.

研究动机与目标

  • 从无专家动作标注的被动第一人称视频中学习可重用、一致的视觉-运动子程序。
  • 通过从视频中学习的子程序初始化策略,提升分层强化学习在导航任务中的样本效率。
  • 仅使用从非结构化第一人称视频数据中获得的伪标签子程序,实现零样本探索和下游任务学习。
  • 在真实机器人平台上部署所学子程序。

提出的方法

  • 在少量随机交互数据上训练自监督逆模型,从图像转换中预测动作。
  • 利用逆模型通过推断能解释连续图像对的动作,对专家第一人称视频中的动作进行伪标签。
  • 将专家轨迹切分为固定长度的子轨迹,以定义候选子程序。
  • 学习一种潜在意图条件策略,将图像观测映射到可预测伪标签动作的离散潜在码。
  • 训练一种功能模型,以预测从给定图像观测中适用的子程序。
  • 在分层强化学习框架中微调子程序和功能模型,用于点目标和区域目标导航任务。

实验结果

研究问题

  • RQ1能否从未结构化的第一人称视频中成功提取视觉-运动子程序,而无需显式动作标注?
  • RQ2从被动视频数据中学习的子程序在新环境中实现零样本探索的效率如何?
  • RQ3这些子程序在多大程度上提升了分层强化学习在导航任务中的样本效率?
  • RQ4所学子程序能否泛化到真实世界机器人部署?

主要发现

  • 与随机初始化和ImageNet初始化的基线方法相比,该方法在点目标和区域目标导航任务中,分层强化学习的训练速度最快提升4倍。
  • 尽管该方法仅使用45K个样本,而DIAYN和Curiosity等最先进技能学习方法使用了200倍更多的交互数据(1000万 vs. 4.5万),但本方法仍表现更优。
  • 功能模型实现了有效的子程序选择,使智能体在新环境中的探索成功率比多个基线方法高出50%。
  • 从视频数据中学到的子程序成功部署在真实机器人平台上,证明了其在真实世界中的泛化能力。
  • 该方法在稀疏奖励设置下表现优异,增益更大,表明对稀疏监督具有鲁棒性。
  • 该方法优于使用Curiosity或DIAYN初始化的单体策略和分层策略,后者在某些设置下退化为平凡策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。