Skip to main content
QUICK REVIEW

[论文解读] Learning 2D-3D Correspondences To Solve The Blind Perspective-n-Point Problem

Liu Liu, Dylan Campbell|arXiv (Cornell University)|Mar 15, 2020
Robotics and Sensor-Based Localization参考文献 31被引用 14
一句话总结

该论文提出了一种深度学习方法,联合估计盲PnP问题中的2D–3D对应关系与6-DoF相机位姿,采用双流PointNet架构进行特征提取,利用最优传输(optimal transport)的全局匹配模块进行对应关系评分,并通过分类头过滤内点。该方法在准确率上达到最先进水平,且相比先前方法实现超过100倍的速度提升,可实现每秒处理数千个点的端到端推理。

ABSTRACT

Conventional absolute camera pose via a Perspective-n-Point (PnP) solver often assumes that the correspondences between 2D image pixels and 3D points are given. When the correspondences between 2D and 3D points are not known a priori, the task becomes the much more challenging blind PnP problem. This paper proposes a deep CNN model which simultaneously solves for both the 6-DoF absolute camera pose and 2D--3D correspondences. Our model comprises three neural modules connected in sequence. First, a two-stream PointNet-inspired network is applied directly to both the 2D image keypoints and the 3D scene points in order to extract discriminative point-wise features harnessing both local and contextual information. Second, a global feature matching module is employed to estimate a matchability matrix among all 2D--3D pairs. Third, the obtained matchability matrix is fed into a classification module to disambiguate inlier matches. The entire network is trained end-to-end, followed by a robust model fitting (P3P-RANSAC) at test time only to recover the 6-DoF camera pose. Extensive tests on both real and simulated data have shown that our method substantially outperforms existing approaches, and is capable of processing thousands of points a second with the state-of-the-art accuracy.

研究动机与目标

  • 解决2D–3D对应关系事先未知的具有挑战性的盲PnP问题。
  • 开发一种深度学习框架,从无序的2D与3D点集联合回归2D–3D对应关系与6-DoF相机位姿。
  • 克服传统基于几何的方法依赖位姿先验或穷举搜索的局限性,这些方法速度慢且对初始化敏感。
  • 通过利用深度特征学习与可微分匹配,实现在复杂场景(含遮挡与异常值)下的实时、高精度相机位姿估计。
  • 提供一个可端到端训练的模型,在合成数据集与真实世界数据集上均优于现有方法,在准确率与推理速度方面表现更优。

提出的方法

  • 一个双流PointNet启发的网络分别处理2D图像关键点与3D场景点,以提取编码局部几何与全局上下文的点级深度特征。
  • 一个全局特征匹配模块使用最优质量传输(OMT)计算所有2D–3D点对之间的匹配度矩阵,通过可微分Sinkhorn层建模对应关系的概率。
  • 按置信度对匹配度矩阵进行排序,生成候选对应关系的优先列表。
  • 对优先列表应用一个内点分类CNN,以过滤异常值并提升对应关系质量。
  • 在推理阶段,使用标准的P3P-RANSAC求解器,基于过滤后的内点匹配恢复最终相机位姿。
  • 整个网络通过损失函数进行端到端训练,该损失函数旨在最大化真实内点对的匹配概率。

实验结果

研究问题

  • RQ1深度神经网络是否能够在不依赖已知对应关系或位姿先验的前提下,联合估计盲PnP问题中的2D–3D对应关系与6-DoF相机位姿?
  • RQ2双流特征提取网络在捕捉跨模态匹配所需的判别性局部与全局几何结构方面是否有效?
  • RQ3可微分最优传输是否能有效用于学习一个软对应矩阵,以优先选择可能的2D–3D匹配?
  • RQ4与仅依赖匹配度矩阵相比,后处理分类头是否能提升内点检测的准确率?
  • RQ5所提方法是否能同时实现高准确率与实时性能,优于传统基于几何的方法在速度与鲁棒性方面的表现?

主要发现

  • 所提方法在合成数据集(ModelNet40、NYU-RGBD)与真实世界数据集(MegaDepth)上均达到最先进准确率,显著优于现有盲PnP方法。
  • 在MegaDepth数据集上,与SoftPOSIT和GOSMA相比,该方法在高异常值比例下将中值旋转误差降低超过50%,平移误差降低超过60%。
  • 该方法每秒可处理超过1,000个点,相比次快基线方法(GOSMA)实现超过100倍的速度提升,后者通常需要数分钟完成一次配准。
  • 端到端训练方案使模型在多样化场景与不同点云密度下具备稳健的泛化能力,即使在存在显著遮挡与噪声的情况下亦表现良好。
  • 消融研究证实,全局匹配模块与内点分类头对高性能均至关重要,后者可将误报率降低高达40%。
  • 即使在极低内点比例(如0.1%)下,该方法仍保持有效性,而RANSAC-based方法因采样不足而失效,表明其具有更优的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。