[论文解读] Reassessing the Limitations of CNN Methods for Camera Pose Regression
本文提出了一种基于CNN的新型相机位姿回归方法,通过概率引导的合成视图生成和基于Transformer的位姿头,解决了数据分布偏差问题,其性能超越了最先进的基于3D结构和检索的方法。该方法在Cambridge Landmarks基准的复杂街道场景中首次实现回归方法超越图像检索,表明无偏的训练数据与改进的网络架构可弥合与基于结构方法之间的性能差距。
In this paper, we address the problem of camera pose estimation in outdoor and indoor scenarios. In comparison to the currently top-performing methods that rely on 2D to 3D matching, we propose a model that can directly regress the camera pose from images with significantly higher accuracy than existing methods of the same class. We first analyse why regression methods are still behind the state-of-the-art, and we bridge the performance gap with our new approach. Specifically, we propose a way to overcome the biased training data by a novel training technique, which generates poses guided by a probability distribution from the training set for synthesising new training views. Lastly, we evaluate our approach on two widely used benchmarks and show that it achieves significantly improved performance compared to prior regression-based methods, retrieval techniques as well as 3D pipelines with local feature matching.
研究动机与目标
- 为解决基于CNN的位姿回归与基于3D结构的方法之间的性能差距,该差距源于训练数据分布的偏差。
- 通过合成多样化、分布对齐的视图,提升回归模型在训练视点之外的泛化能力。
- 证明在具有挑战性的户外场景中,直接回归可超越检索与3D匹配方法。
- 表明基于Transformer的架构在相对位姿回归中优于标准MLP。
- 验证融合密集与稀疏深度的合成视图可提升模型的鲁棒性与准确性。
提出的方法
- 基于概率的视图合成流程通过从训练位姿的经验分布中采样,生成新的训练位姿,从而减少数据偏差。
- 利用多视角立体(MVS)的稀疏度量深度与密集的尺度无关深度预测的融合,生成合成图像,以提升视觉质量并减少伪影。
- 采用基于Transformer的位姿头替代传统MLP,以更好地建模图像对之间的相对位姿关系。
- 该方法在真实图像对与合成图像对的组合上进行训练,其中每个真实图像均与一个新颖的、合成生成的视图配对。
- 优化密集深度采样,以提升合成视图的逼真度与一致性,尤其在稀疏区域。
- 训练过程同时使用分布内与分布外的合成视图,以评估泛化能力与数据效率。
实验结果
研究问题
- RQ1尽管存在已知的泛化局限性,基于CNN的位姿回归能否实现与基于3D结构的方法相当或更优的性能?
- RQ2通过训练位姿分布引导生成的合成视图,是否能减少训练与测试数据之间的领域偏移?
- RQ3在此背景下,基于Transformer的架构是否能优于标准MLP提升相对位姿回归性能?
- RQ4当真实数据有限时,使用合成数据能在多大程度上提升性能?
- RQ5在大型复杂户外场景中,仅回归的方法能否超越图像检索?
主要发现
- 在Cambridge Landmarks基准的街道场景中,该方法结合Transformer与合成视图,实现了0.24/0.38的中位误差,优于MLP基线与图像检索方法。
- 在7 Scenes数据集中,仅使用10%的真实图像及其合成对应物进行训练,性能优于使用100%真实图像,证明数据效率与分布对齐比数据量更为关键。
- 该方法是首个在Cambridge Landmarks基准中最大、最复杂的街道场景上超越图像检索性能的回归方法。
- 与MLP相比,基于Transformer的位姿头将中位误差降低最多达20%,证明其在建模相对位姿关系方面的优越性。
- 通过融合密集与稀疏深度生成的合成视图显著减少了孔洞与飞点等伪影,提升了模型的泛化能力。
- 即使合成图像存在不完美之处,模型仍能很好地泛化到真实测试图像,表现出对局部图像噪声与缺失区域的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。