[论文解读] Scene Coordinate Regression with Angle-Based Reprojection Loss for Camera Relocalization
本文提出一种基于角度的重投影损失,用于相机重定位中的场景坐标回归,实现了无需精细初始化的端到端训练,并提升了位姿精度。该方法通过新型损失函数利用多视角约束,在7-Scenes和Cambridge Landmarks数据集上达到最先进性能,相较于DSAC++在7-Scenes上无初始化设置时提升8.8个百分点。
Image-based camera relocalization is an important problem in computer vision and robotics. Recent works utilize convolutional neural networks (CNNs) to regress for pixels in a query image their corresponding 3D world coordinates in the scene. The final pose is then solved via a RANSAC-based optimization scheme using the predicted coordinates. Usually, the CNN is trained with ground truth scene coordinates, but it has also been shown that the network can discover 3D scene geometry automatically by minimizing single-view reprojection loss. However, due to the deficiencies of the reprojection loss, the network needs to be carefully initialized. In this paper, we present a new angle-based reprojection loss, which resolves the issues of the original reprojection loss. With this new loss function, the network can be trained without careful initialization, and the system achieves more accurate results. The new loss also enables us to utilize available multi-view constraints, which further improve performance.
研究动机与目标
- 消除相机重定位中场景坐标回归网络对精细初始化的需求。
- 通过设计比标准重投影损失更鲁棒的损失函数,提升定位精度。
- 在训练过程中利用多视角几何约束,增强三维几何发现能力。
- 证明新损失函数即使在缺乏真实场景坐标的情况下,也能实现收敛并取得更优性能。
提出的方法
- 提出一种基于角度的重投影损失,通过测量预测与真实3D点在图像平面上的投影之间的角度差异,替代标准的L2重投影误差。
- 利用该损失训练一个卷积神经网络(CNN),从单张RGB图像预测3D场景坐标,实现无需坐标初始化的端到端学习。
- 通过在训练过程中对多视角下的对应2D-3D匹配应用基于角度的损失,整合多视角约束。
- 将基于角度的损失与光度重建损失结合,进一步正则化预测结果,提升几何一致性。
- 采用两阶段流程:首先通过CNN进行坐标预测,随后基于预测的2D-3D对应关系使用RANSAC进行位姿估计。
- 调整多视角损失与光度损失之间的平衡权重λ,以避免因过度正则化导致性能下降。
实验结果
研究问题
- RQ1是否可通过新型损失函数消除相机重定位中场景坐标回归对精细初始化的需求?
- RQ2基于角度的重投影损失是否相比标准重投影损失能实现更好的收敛性和更高精度?
- RQ3能否在新损失函数下有效利用训练过程中的多视角几何约束?
- RQ4光度重建损失的集成如何影响坐标网络的性能?
主要发现
- 所提出的基于角度的重投影损失使坐标网络在无任何初始化的情况下成功训练,在7-Scenes数据集上达到88.6%的准确率(2cm,1.0°阈值),相比DSAC++无初始化设置时提升8.8个百分点。
- 在Cambridge Landmarks数据集中,该方法在五组场景中的四组中实现了优于DSAC++的中位数位姿精度,表明在多样化环境中具有持续改进表现。
- 通过新损失函数整合多视角约束可提升性能,最佳结果出现在结合基于角度的重投影损失与光度重建损失时。
- 使用原始重投影损失无初始化训练在大多数场景中均无法收敛,凸显了所提损失在鲁棒训练中的必要性。
- 在完整的7-Scenes基准测试中,该方法达到71.8%的准确率(2cm,1.0°),优于DSAC++无初始化设置,且接近DSAC++在完整3D模型监督下的性能(76.1%)。
- 敏感性分析表明,不当的权重设置(如光度损失的λ=50)会降低性能,表明需谨慎调整超参数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。