Skip to main content
QUICK REVIEW

[论文解读] Learning to Visually Navigate in Photorealistic Environments Without any Supervision

Lina Mezghani, Sainbayar Sukhbaatar|arXiv (Cornell University)|Apr 10, 2020
Multimodal Machine Learning Applications参考文献 40被引用 9
一句话总结

本文提出了一种自监督的三阶段框架,用于在仅使用RGB观测且无外部奖励或监督的情况下,在逼真视觉环境中进行视觉导航。该方法通过对比学习学习视觉表征,利用包含离散内在奖励的场景记忆缓冲区进行探索,并通过自生成目标训练导航策略,在Gibson数据集上实现了与监督基线相当的性能。

ABSTRACT

Learning to navigate in a realistic setting where an agent must rely solely on visual inputs is a challenging task, in part because the lack of position information makes it difficult to provide supervision during training. In this paper, we introduce a novel approach for learning to navigate from image inputs without external supervision or reward. Our approach consists of three stages: learning a good representation of first-person views, then learning to explore using memory, and finally learning to navigate by setting its own goals. The model is trained with intrinsic rewards only so that it can be applied to any environment with image observations. We show the benefits of our approach by training an agent to navigate challenging photo-realistic environments from the Gibson dataset with RGB inputs only.

研究动机与目标

  • 开发一种在逼真视觉环境中无需任何外部监督或奖励即可运行的导航智能体。
  • 使智能体仅使用RGB输入,学习能够区分近处与远处位置的视觉表征。
  • 训练一种探索策略,利用场景记忆缓冲区引导探索,而不依赖连续的内在奖励。
  • 通过自生成目标和基于记忆缓冲区的内在塑造,学习一种目标导向的导航策略。
  • 在复杂、类真实世界环境中,展示模型的泛化能力并达到与监督方法相当的性能。

提出的方法

  • 智能体首先使用对比学习目标学习视觉表征,以区分近距离和远距离的图像对。
  • 通过仅在状态的特征表征与缓冲区中所有现有条目均不相似时,才将状态添加到场景记忆缓冲区(SMB)中,实现探索。
  • 使用离散的内在奖励来塑造探索过程,避免连续奖励函数导致陷入局部最优的问题。
  • 利用基于Transformer的注意力机制,对SMB进行操作,选择通往自生成目标的动作,从而训练导航策略。
  • 整个系统以端到端的自监督方式训练,不访问位置、深度或外部奖励信息。
  • SMB同时发挥双重作用:塑造内在奖励,并为探索和导航策略提供上下文支持。

实验结果

研究问题

  • RQ1智能体能否仅使用RGB观测且无外部监督或奖励,在逼真视觉环境中实现导航?
  • RQ2如何设计内在探索机制,以避免在复杂环境中陷入局部最优并实现高覆盖率?
  • RQ3自监督视觉表征模型是否具备足够的泛化能力,以在无真实标签监督的情况下支持有效导航?
  • RQ4在缺乏显式监督的情况下,基于记忆的注意力机制在多大程度上能提升探索与导航性能?
  • RQ5自监督智能体在具有挑战性的类真实世界环境中,能否实现与监督基线相当的性能?

主要发现

  • 所提方法实现了与直接优化覆盖率的监督型基准智能体相当的探索覆盖率,表明其在无监督探索中具有强大性能。
  • 使用离散内在奖励显著优于连续奖励,后者因奖励利用导致智能体陷入局部区域。
  • 智能体在探索过程中成功构建了环境的拓扑一致图,如Ballou环境中的可视化所示。
  • 消融实验证实,离散奖励和基于SMB的注意力机制对有效探索均至关重要。
  • 最终的导航策略可泛化至未见过环境中的新测试目标,展示了自监督方法的鲁棒性。
  • 该模型在Gibson数据集上优于所有基线模型,即使在无任何外部监督或奖励信号的情况下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。