Skip to main content
QUICK REVIEW

[论文解读] No RL, No Simulation: Learning to Navigate without Navigating

Meera Hahn, Devendra Singh Chaplot|arXiv (Cornell University)|Oct 18, 2021
Reinforcement Learning in Robotics参考文献 40被引用 7
一句话总结

本文提出NRNS,一种无需强化学习(RL)或模拟器的自监督导航方法,通过被动第一视角视频进行训练。通过在SLAM生成的位姿下对RGBD视频训练地理解距离估计器和目标预测模型,NRNS在性能上优于基于RL的方法,即使在真实世界视频上训练,也显著超越基线模型。

ABSTRACT

Most prior methods for learning navigation policies require access to simulation environments, as they need online policy interaction and rely on ground-truth maps for rewards. However, building simulators is expensive (requires manual effort for each and every scene) and creates challenges in transferring learned policies to robotic platforms in the real-world, due to the sim-to-real domain gap. In this paper, we pose a simple question: Do we really need active interaction, ground-truth maps or even reinforcement-learning (RL) in order to solve the image-goal navigation task? We propose a self-supervised approach to learn to navigate from only passive videos of roaming. Our approach, No RL, No Simulator (NRNS), is simple and scalable, yet highly effective. NRNS outperforms RL-based formulations by a significant margin. We present NRNS as a strong baseline for any future image-based navigation tasks that use RL or Simulation.

研究动机与目标

  • 探究强化学习(RL)和模拟器是否对图像目标导航任务至关重要。
  • 解决在合成模拟器中训练导致的模拟到真实世界域差距问题。
  • 开发一种可扩展的自监督方法,仅从被动视频数据中学习导航。
  • 证明基于学习到的距离估计的简单贪婪策略可超越复杂的强化学习策略。
  • 在真实世界的被动视频上验证该方法,展示其无需模拟到真实世界迁移的性能。

提出的方法

  • 训练一个测地距离估计器,用于根据当前状态特征和目标图像,预测到布局图中未探索区域的最短路径距离。
  • 使用SLAM从被动RGBD视频中估计相对相机位姿,实现场景结构建模而无需主动交互。
  • 训练目标预测模型,利用图像和目标特征判断目标图像是否从当前位置可见且可达。
  • 应用贪婪策略,基于最小化预测的测地距离来选择下一步动作。
  • 仅使用被动视频数据进行训练——无需在线交互、无需真实地图,也无需奖励塑造。
  • 利用深度图来剔除无效动作并实现局部障碍物避让,从而避免对碰撞奖励信号的依赖。

实验结果

研究问题

  • RQ1是否可以在不使用强化学习或模拟环境的情况下有效学习导航?
  • RQ2仅使用被动视频轨迹的自监督方法能否超越端到端强化学习方法?
  • RQ3基于被动数据训练的距离估计器在真实世界导航任务中能多大程度上实现泛化?
  • RQ4基于学习到的距离估计的贪婪策略是否在样本效率和真实世界迁移能力上优于强化学习策略?
  • RQ5该模型是否可在未经筛选的真实世界视频(如房地产导览视频)上成功训练,并仍实现优异性能?

主要发现

  • 即使强化学习方法使用了5倍的数据和10倍的计算资源,NRNS在性能上仍显著优于端到端强化学习方法。
  • 在Gibson数据集上,NRNS在“简单直线路径”任务中取得68.00%的成功率和61.62%的SPL,优于行为克隆基线(30.20%成功率),并在部分设置中与强化学习基线持平或超越。
  • 在RealEstate10K真实世界视频上进行训练时,NRNS在“简单直线路径”任务中取得56.42%的成功率和48.01%的SPL,表明其在真实数据上具备强大的零样本迁移能力。
  • 消融实验表明,测地距离估计器(G_D)对性能影响最大,尤其在“困难”和“曲线”等复杂路径设置中表现显著。
  • 在RealEstate10K上训练时性能相比Gibson有所下降,但依然具有竞争力——表明存在域偏移,但泛化能力依然很强。
  • 当在Gibson上训练时,NRNS在“曲线困难路径”任务中取得35.50%的成功率和18.38%的SPL,优于行为克隆基线(3.10%成功率),展现出对路径复杂度的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。