Skip to main content
QUICK REVIEW

[论文解读] RenderNet: Visual Relocalization Using Virtual Viewpoints in Large-Scale Indoor Environments

Jiahui Zhang, Shitao Tang|arXiv (Cornell University)|Jul 26, 2022
Advanced Image and Video Retrieval Techniques被引用 6
一句话总结

RenderNet 通过利用学习到的全局和局部特征生成虚拟视点,而非渲染逼真的图像,提出了一种新颖的方法来解决大规模室内环境中视觉重定位的问题。通过将这些虚拟视点加入数据库并利用它们进行姿态优化,该方法提升了图像检索和特征匹配性能,在 Inloc 数据集上严格姿态阈值下分别实现了 7.1% 和 12.2% 的准确率提升。

ABSTRACT

Visual relocalization has been a widely discussed problem in 3D vision: given a pre-constructed 3D visual map, the 6 DoF (Degrees-of-Freedom) pose of a query image is estimated. Relocalization in large-scale indoor environments enables attractive applications such as augmented reality and robot navigation. However, appearance changes fast in such environments when the camera moves, which is challenging for the relocalization system. To address this problem, we propose a virtual view synthesis-based approach, RenderNet, to enrich the database and refine poses regarding this particular scenario. Instead of rendering real images which requires high-quality 3D models, we opt to directly render the needed global and local features of virtual viewpoints and apply them in the subsequent image retrieval and feature matching operations respectively. The proposed method can largely improve the performance in large-scale indoor environments, e.g., achieving an improvement of 7.1\% and 12.2\% on the Inloc dataset.

研究动机与目标

  • 为解决大规模室内环境中因视角和外观剧烈变化而导致视觉重定位性能下降的挑战。
  • 改善重定位流程中图像检索与 2D-3D 对应特征匹配的性能,尤其是在真实数据库图像与查询图像重叠度较低的情况下。
  • 通过仅直接合成虚拟视点所需的全局和局部特征,消除对高成本、高保真度 3D 模型的依赖。
  • 通过两阶段操作提升重定位准确率:利用虚拟特征进行视图增强,以及利用粗略估计姿态进行姿态优化。
  • 证明基于特征的虚拟视图生成在鲁棒性和性能方面优于基于图像的合成方法。

提出的方法

  • RenderNet 使用神经网络直接预测虚拟视点的全局特征,这些特征用于图像检索,以找到与之更匹配的数据库视图。
  • 另一个独立网络 RenderNet_L 预测虚拟视图的优化局部特征描述符,以提升 2D-3D 特征匹配的准确性。
  • 在场景中预先采样虚拟视点,以确保覆盖多样化的相机角度,从而在检索阶段实现视图增强。
  • 在通过 RANSAC 和 PnP 完成初始姿态估计后,利用粗略姿态生成新的虚拟视图,以通过改进的对应关系实现姿态优化。
  • 该方法避免图像合成,仅聚焦于最终所需的特征,从而减少伪影并提高鲁棒性。
  • 模型在目标数据集(Inloc)上进行微调,以适应场景特有的外观变化,从而提升性能。

实验结果

研究问题

  • RQ1使用学习到的特征生成虚拟视点是否能提升大规模室内重定位中的图像检索性能?
  • RQ2仅生成必要特征(全局和局部)是否在重定位准确率和鲁棒性方面优于完整的图像合成?
  • RQ3利用虚拟特征进行视图增强在多大程度上减轻了查询图像与真实数据库图像之间重叠度低的影响?
  • RQ4利用粗略姿态估计生成的虚拟视图进行姿态优化,在多大程度上提升了最终定位准确率?
  • RQ5在目标数据集上对 RenderNet 进行微调是否显著提升了真实室内环境中性能?

主要发现

  • 在 Inloc 数据集的 DUC1 场景下,RenderNet 在 (0.25m, 2°) 阈值下实现了 7.1% 的准确率提升,在 DUC2 场景下实现了 12.2% 的准确率提升,表明性能显著增强。
  • 仅视图增强阶段便在 DUC1 场景下分别实现了 4.0%、5.6% 和 6.5% 的准确率提升,而在 DUC2 场景下分别实现了 16.0%、15.3% 和 12.2% 的准确率提升,对应三个阈值。
  • 与仅使用视图增强相比,姿态优化在 (0.25m, 2°) 阈值下进一步将准确率提升了 4.6% 和 9.9%。
  • 完整 RenderNet 流程在 DUC1 和 DUC2 场景下,于 (5m, 10°) 阈值下分别实现了 25.9% 和 13.7% 的准确率提升。
  • 若移除局部特征优化模块(RenderNet_L),在 (5m, 10°) 阈值下性能下降 8.1%,证明其在处理大视角变化方面的有效性。
  • 在 Inloc 数据集上对 RenderNet 进行微调,在 (5m, 10°) 阈值下分别带来 3.5% 和 6.9% 的性能增益,证实其在领域自适应中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。