[论文解读] Scene Coordinate and Correspondence Learning for Image-Based Localization
本文提出了一种基于深度学习的图像相机重定位框架,通过单张RGB图像联合回归场景坐标及其预测置信度。通过为2D-3D对应关系预测置信度分数,该方法可早期过滤异常值,从而实现更鲁棒的姿态估计与优化,在仅使用RGB输入的7-Scenes数据集上实现了3.1°旋转误差和4.0 cm平移误差的最先进精度。
Scene coordinate regression has become an essential part of current camera re-localization methods. Different versions, such as regression forests and deep learning methods, have been successfully applied to estimate the corresponding camera pose given a single input image. In this work, we propose to regress the scene coordinates pixel-wise for a given RGB image by using deep learning. Compared to the recent methods, which usually employ RANSAC to obtain a robust pose estimate from the established point correspondences, we propose to regress confidences of these correspondences, which allows us to immediately discard erroneous predictions and improve the initial pose estimates. Finally, the resulting confidences can be used to score initial pose hypothesis and aid in pose refinement, offering a generalized solution to solve this task.
研究动机与目标
- 通过利用深度学习进行场景坐标预测,提升在遮挡和低纹理等挑战性条件下的相机重定位精度。
- 通过为2D-3D对应关系引入置信度预测,解决基于RANSAC方法的局限性,实现对错误匹配的早期过滤。
- 开发一种通用框架,提升初始姿态假设的质量,并支持灵活的姿态优化,无需硬编码优化阈值。
- 分析不同损失函数与正则化技术对场景坐标回归质量的影响。
- 证明置信度预测可实现优于直接姿态回归或标准对应关系方法的性能。
提出的方法
- 训练一个深度神经网络,从单张RGB输入图像中为每个像素预测密集的3D场景坐标。
- 在损失函数中引入一种新颖的平滑正则化项,以提升回归场景坐标的时空一致性。
- 训练一个独立的置信度分支,用于预测每个2D-3D对应关系的可靠性,从而实现对低置信度匹配的早期剔除。
- 利用置信度分数对姿态假设进行评分与过滤,提升对异常值的鲁棒性。
- 使用PnP或Kabsch算法进行姿态估计,并通过置信度加权的对应关系应用优化。
- 该框架模块化设计,兼容多种姿态估计算法,支持即插即用的集成。
实验结果
研究问题
- RQ1与标准对应关系方法相比,联合回归场景坐标及其置信度分数是否能提升相机重定位精度?
- RQ2在损失函数中引入平滑正则化项对回归场景坐标的质量与一致性有何影响?
- RQ3置信度预测在多大程度上能减少错误对应关系的数量,并提升姿态估计的鲁棒性?
- RQ4与直接姿态回归基线方法(如PoseNet)及最先进的基于对应关系的方法(如DSAC)相比,所提方法表现如何?
- RQ5基于置信度的过滤机制是否能跨不同场景与数据集泛化,而无需重新训练?
主要发现
- 在仅使用RGB输入的7-Scenes数据集上,该方法实现了3.1°的中值旋转误差与4.0 cm的中值平移误差,优于PoseNet,并达到最先进方法的水平。
- 在RGB-D输入下,该方法实现了2.5°的中值误差与5.2 cm的中值误差,显著优于仅使用RGB的结果,并在性能上强于场景坐标回归随机森林方法。
- 置信度预测机制减少了姿态估计所需的内点数量,使得在更少对应关系下也能实现高精度结果。
- 即使使用标准PnP与RANSAC,该方法仍能提升姿态精度,原因在于在假设生成前已对低置信度对应关系进行了过滤。
- 该框架计算效率高,在CPU上运行时间为1.06秒(使用GPU加速网络推理),尽管基于Python实现,但速度仍优于基于C++的DSAC。
- 消融实验表明,置信度预测显著提升了姿态精度,尤其在Stairs等挑战性场景中,相比基线方法误差降低超过50%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。