Skip to main content
QUICK REVIEW

[论文解读] InLoc: Indoor Visual Localization with Dense Matching and View Synthesis

Hajime Taira, Masatoshi Okutomi|arXiv (Cornell University)|Mar 28, 2018
Robotics and Sensor-Based Localization参考文献 2被引用 46
一句话总结

InLoc 提出一个大规模室内视觉定位管线,使用密集 CNN 基于匹配和虚拟视图合成来实现对抗挑战性室内变化的鲁棒 6DoF 姿态估计。它引入了一个新数据集,并在现有方法上显示显著提升。

ABSTRACT

We seek to predict the 6 degree-of-freedom (6DoF) pose of a query photograph with respect to a large indoor 3D map. The contributions of this work are three-fold. First, we develop a new large-scale visual localization method targeted for indoor environments. The method proceeds along three steps: (i) efficient retrieval of candidate poses that ensures scalability to large-scale environments, (ii) pose estimation using dense matching rather than local features to deal with textureless indoor scenes, and (iii) pose verification by virtual view synthesis to cope with significant changes in viewpoint, scene layout, and occluders. Second, we collect a new dataset with reference 6DoF poses for large-scale indoor localization. Query photographs are captured by mobile phones at a different time than the reference 3D map, thus presenting a realistic indoor localization scenario. Third, we demonstrate that our method significantly outperforms current state-of-the-art indoor localization approaches on this new challenging data.

研究动机与目标

  • 解决在纹理缺失和重复结构的大规模室内环境中实现准确的 6DoF 定位的挑战。
  • 提出一个定位管线,结合高效的候选姿态检索、基于密集特征的姿态估计,以及通过视图合成进行验证。
  • 创建并发布一个真实的室内定位数据集,包含智能手机查询图像和时间偏移的参考图像。
  • 证明密集匹配和视图合成验证优于现有的室内定位方法。

提出的方法

  • 使用 CNN 派生特征(conv5 然后 conv3)在网格上执行从粗到细的密集匹配以进行姿态估计,以克服稀疏特征的缺乏。
  • 用 NetVLAD 描述子检索候选数据库图像,并通过 RANSAC 内点重新排序以减少候选数量(前10 名)。
  • 使用深度背靠的数据库图像 3D 结构,通过 P3P-LO-RANSAC 估计 6DoF 姿态。
  • 通过虚拟视图合成验证姿态:从估计姿态渲染一个视图并与查询进行比较,使用 DenseSIFT/RootSIFT 描述子在整张图像上衡量正面和负面证据,对光照变化具有鲁棒性。
  • 对 CNN 特征进行二值化以在几乎无损失的情况下减小内存开销,实现可扩展匹配。
  • 在基线(Direct 2D-3D、Disloc、NetVLAD+SparsePE)上进行评估与比较,并对组件进行消融(DensePE、DensePV)。

实验结果

研究问题

  • RQ1在纹理缺失的室内场景中,密集特征匹配相较于稀疏特征方法能在姿态估计上带来怎样的改进?
  • RQ2通过视图合成进行姿态验证对在具有大视角变化和光照变化的室内环境中的定位准确性有何影响?
  • RQ3将密集匹配与鲁棒检索和验证相结合,是否能在大型室内数据集上对现有室内定位方法带来可衡量的提升?

主要发现

  • InLoc 在新的大规模数据集上超越了现有室内定位基线,在 0.25m、0.50m 和 1.00m 阈值下的正确定位查询数量显著提升。
  • 密集姿态估计(DensePE)在使用 NetVLAD 基于检索时,较稀疏特征匹配提高了约 15 个百分点的定位率。
  • 通过视图合成进行姿态验证(DensePV)提供显著且稳定的提升,尤其是在位置精度在 1.5m 内时。
  • 二值 CNN 特征将内存减少了 32x,几乎无性能损失(在 0.5m 时小于 1%)。
  • 与 Disloc 和 NetVLAD 基线相比,InLoc 的定位准确性显著更高(例如 0.25m:38.9% vs 11.9%/21.3%),显示了密集匹配和视图合成的好处。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。