[论文解读] To Learn or Not to Learn: Visual Localization from Essential Matrices
本文提出了一种新颖且轻量级的视觉定位框架,通过基于RANSAC的方法利用本质矩阵实现,该方法与本质矩阵的估计方式无关。实验表明,尽管学习到的特征匹配具有良好的泛化能力,但端到端的本质矩阵回归由于回归头的泛化能力差而无法泛化,且即使采用混合学习特征的方法也逊于经典的SIFT方法,凸显了当前基于学习的视觉定位方法在关键方面的局限性。
Visual localization is the problem of estimating a camera within a scene and a key component in computer vision applications such as self-driving cars and Mixed Reality. State-of-the-art approaches for accurate visual localization use scene-specific representations, resulting in the overhead of constructing these models when applying the techniques to new scenes. Recently, deep learning-based approaches based on relative pose estimation have been proposed, carrying the promise of easily adapting to new scenes. However, it has been shown such approaches are currently significantly less accurate than state-of-the-art approaches. In this paper, we are interested in analyzing this behavior. To this end, we propose a novel framework for visual localization from relative poses. Using a classical feature-based approach within this framework, we show state-of-the-art performance. Replacing the classical approach with learned alternatives at various levels, we then identify the reasons for why deep learned approaches do not perform well. Based on our analysis, we make recommendations for future work.
研究动机与目标
- 探究基于相对位姿估计的深度学习视觉定位方法为何在性能上逊于经典方法。
- 开发一种通用且与场景无关的视觉定位框架,利用本质矩阵与RANSAC恢复绝对相机位姿。
- 分离并分析影响学习型相对位姿估计泛化能力与准确性的关键组件。
- 在统一框架下比较经典特征方法、端到端学习的本质矩阵回归以及混合学习特征匹配方法。
- 为未来可泛化的、数据驱动的视觉定位研究提供可操作的见解。
提出的方法
- 提出一种新颖的基于RANSAC的框架,通过在查询图像与多个数据库图像之间估计的本质矩阵,计算绝对相机位姿。
- 设计一种灵活的流水线,允许通过经典方法(SIFT)、学习回归方法(EssNet)或混合方法(学习匹配 + SIFT风格5点求解器)计算本质矩阵。
- 设计一种新型基于CNN的网络(EssNet),直接从图像对回归本质矩阵,训练数据集包括MegaDepth、7 Scenes和Cambridge Landmarks。
- 采用混合方法,将SIFT替换为在无关数据集(ivd)上预训练的端到端特征匹配模块(NCM),同时仍使用5点算法进行位姿估计。
- 在混合设置中采用高分辨率推理进行特征匹配,尽管训练时使用较低分辨率(224×224)以提升计算效率。
- 在多个数据集和训练策略下评估泛化性能,包括ImageNet预训练以及在深度图与室内外场景上的任务特定微调。
实验结果
研究问题
- RQ1为何端到端学习的相对位姿回归方法尽管使用了深度网络,却在未见场景中泛化失败?
- RQ2这些网络学习到的特征在不同场景和领域之间泛化程度如何?
- RQ3学习方法与经典方法之间的性能差距,是源于回归头、特征提取,还是匹配过程?
- RQ4结合学习特征匹配与经典位姿估计的混合方法,是否能超越纯学习或纯经典方法?
- RQ5学习流水线中的哪些组件对实现视觉定位的准确性与泛化能力最为关键?
主要发现
- 经典SIFT方法(SIFT+5pt)在Cambridge Landmarks数据集上达到最先进性能(中位误差0.47/均值误差0.88),优于更复杂的深度学习方法。
- 端到端本质矩阵回归(EssNet)性能劣于SIFT方法,在Cambridge Landmarks数据集上中位误差为0.83/均值误差1.36,表明泛化能力差。
- 网络学习到的特征及其匹配在不同数据集间具有良好的泛化能力:在不同预训练任务和数据集上性能差异极小(中位误差0.89–0.98)。
- 采用学习匹配(NCM)与SIFT风格5点求解器的混合方法,在Cambridge数据集上取得优于纯回归方法的结果(中位误差0.89/均值误差1.39),但仍逊于SIFT方法(中位误差0.47/均值误差0.88)。
- 学习方法的主要失败模式在于回归头,而非特征提取或匹配过程,这一点通过不同特征训练策略下一致的性能差距得到验证。
- 即使使用高质量学习特征,其生成的位姿估计仍不如经典SIFT方法准确,表明当前深度网络在学习鲁棒、局部化的相对位姿表示方面仍存在根本性缺陷。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。