Skip to main content
QUICK REVIEW

[论文解读] The AdobeIndoorNav Dataset: Towards Deep Reinforcement Learning based Real-world Indoor Robot Visual Navigation

Kaichun Mo, Haoxiang Li|arXiv (Cornell University)|Feb 24, 2018
Multimodal Machine Learning Applications参考文献 26被引用 22
一句话总结

本文介绍了AdobeIndoorNav数据集,这是一个高质量的真实世界室内视觉导航基准,包含24个场景中密集采样的360°全景图像和3D重建结果。该数据集支持使用真实视觉输入进行深度强化学习(DRL)训练,并表明标准DRL策略由于空间特征表示不佳,无法泛化到附近目标,而通过使用早期卷积神经网络层中的空间感知特征,可将未见场景下的零样本泛化准确率从53.0%提升至72.6%。

ABSTRACT

Deep reinforcement learning (DRL) demonstrates its potential in learning a model-free navigation policy for robot visual navigation. However, the data-demanding algorithm relies on a large number of navigation trajectories in training. Existing datasets supporting training such robot navigation algorithms consist of either 3D synthetic scenes or reconstructed scenes. Synthetic data suffers from domain gap to the real-world scenes while visual inputs rendered from 3D reconstructed scenes have undesired holes and artifacts. In this paper, we present a new dataset collected in real-world to facilitate the research in DRL based visual navigation. Our dataset includes 3D reconstruction for real-world scenes as well as densely captured real 2D images from the scenes. It provides high-quality visual inputs with real-world scene complexity to the robot at dense grid locations. We further study and benchmark one recent DRL based navigation algorithm and present our attempts and thoughts on improving its generalizability to unseen test targets in the scenes.

研究动机与目标

  • 通过提供高保真真实世界数据集,解决基于DRL的机器人导航中合成场景与真实世界场景之间的领域差距。
  • 支持使用实际室内环境中真实、密集采样的视觉输入进行DRL策略训练。
  • 研究最先进DRL导航策略在真实世界设置下泛化失败的原因,特别是靠近目标时的导航错误。
  • 提出并实证验证一种空间感知特征表示方法,以提升策略对相似附近视图的鲁棒性。

提出的方法

  • 使用半自动、可复现的流程,在24个真实室内场景中以0.4–0.5米间距的密集网格位置采集360°全景图像和3D点云重建结果。
  • 使用真实机器人配合SLAM技术捕获高质量视觉输入并重建3D场景,最大限度减少常见3D重建流程中的伪影。
  • 采用目标驱动的DRL框架,代理通过四类离散动作(前进、后退、左转、右转)从视觉输入导航至目标视图。
  • 将标准的2,048维全局平均池化CNN特征替换为来自更早卷积层的空间感知$7\times7\times2048$特征图,以保留空间上下文信息。
  • 采用孪生网络通过预测两组相邻视图之间的正确动作(如前进/后退、左转/右转)来评估特征质量。
  • 在相同场景和跨场景的图像对上分别训练和测试孪生模型,以评估零样本泛化性能。

实验结果

研究问题

  • RQ1在真实世界视觉输入上训练的基于DRL的视觉导航策略,能否泛化到同一环境中未见过的测试目标?
  • RQ2尽管已学习到粗略的布局感知,为何DRL策略仍无法抵达附近目标?
  • RQ3在视觉特征中保留空间结构是否能提升真实世界导航中对相似附近视图的泛化能力?
  • RQ4当使用空间感知特征而非标准全局特征时,DRL策略的性能如何变化?
  • RQ5诊断性孪生网络能否有效衡量视觉特征在近目标导航中的判别能力?

主要发现

  • 标准DRL策略因无法区分视觉上相似的视图,即使已成功导航至目标附近,仍无法抵达附近目标。
  • 使用2,048维全局平均池化特征时,在同一场景中匹配相邻视图的准确率仅为83.5%。
  • 将全局特征替换为$7\times7\times2048$的空间感知特征图后,同一场景中的匹配准确率提升至87.5%。
  • 在未见场景中,性能提升更为显著:零样本泛化准确率从53.0%提升至72.6%。
  • 诊断实验确认,空间感知特征编码了更多关键的判别性空间信息,有助于解决近目标导航失败问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。