Skip to main content
QUICK REVIEW

[论文解读] Matchable Image Retrieval by Learning from Surface Reconstruction

Tianwei Shen, Zixin Luo|arXiv (Cornell University)|Nov 26, 2018
Advanced Image and Video Retrieval Techniques参考文献 43被引用 9
一句话总结

本文提出一种基于CNN的方法用于可匹配图像检索——具体而言是检索对3D重建至关重要的重叠图像,通过利用密集3D表面重建生成细粒度的训练数据。该方法引入一种带有网格重投影的批量掩码三元组损失,以学习几何感知特征,在可匹配检索基准上显著优于传统的BoW模型和先前的CNN方法。

ABSTRACT

Convolutional Neural Networks (CNNs) have achieved superior performance on object image retrieval, while Bag-of-Words (BoW) models with handcrafted local features still dominate the retrieval of overlapping images in 3D reconstruction. In this paper, we narrow down this gap by presenting an efficient CNN-based method to retrieve images with overlaps, which we refer to as the matchable image retrieval problem. Different from previous methods that generates training data based on sparse reconstruction, we create a large-scale image database with rich 3D geometrics and exploit information from surface reconstruction to obtain fine-grained training data. We propose a batched triplet-based loss function combined with mesh re-projection to effectively learn the CNN representation. The proposed method significantly accelerates the image retrieval process in 3D reconstruction and outperforms the state-of-the-art CNN-based and BoW methods for matchable image retrieval. The code and data are available at https://github.com/hlzz/mirror.

研究动机与目标

  • 解决基于CNN的方法与BoW方法在可匹配图像检索中的性能差距,其中几何重叠而非语义相似性是3D重建的关键。
  • 克服现有CNN方法的局限性,这些方法在物体检索数据集上进行训练,无法捕捉局部几何重叠。
  • 构建大规模、富含几何信息的数据集(GL3D),以减少数据偏差,并实现在真实3D重建场景中的训练。
  • 设计一种自监督流程,利用3D表面重建中的密集对应关系生成细粒度、重叠感知的训练数据。
  • 设计一种高效、可扩展的训练目标,整合区域信息与几何一致性,以提升在重叠图像上的检索准确性。

提出的方法

  • 构建GL3D,一个包含378个场景和完整3D重建的大规模SfM数据集,为训练提供丰富的几何监督。
  • 通过3D网格重建中的密集对应关系自动生成真实训练数据,生成指示图像重叠区域的重叠掩码。
  • 提出一种批量掩码三元组损失(MTL),鼓励重叠图像对的特征嵌入更接近,同时保持非重叠对之间的分离。
  • 在训练过程中集成网格重投影,通过将特征投影回3D网格表面来强制实现几何一致性。
  • 应用后处理步骤,利用区域匹配技术通过局部特征对齐来优化检索结果。
  • 使用同批内挖掘(in-batch mining)以加速大规模数据集上的训练并提高优化效率。

实验结果

研究问题

  • RQ1基于CNN的方法能否在以几何重叠为主要标准的可匹配图像检索中超越传统的BoW模型?
  • RQ2如何利用3D表面重建生成高质量、细粒度的图像检索训练数据?
  • RQ3一种同时结合全局嵌入与局部区域信息的损失函数能否提升在重叠图像上的检索性能?
  • RQ4在大规模、富含几何信息的数据集(GL3D)上进行训练能否缓解标准物体检索基准中存在的数据偏差?
  • RQ5集成网格重投影与重叠掩码是否能带来更鲁棒、更准确的特征学习,以提升3D重建流程的性能?

主要发现

  • 所提方法在SfM中的可匹配图像检索任务上,优于最先进的基于CNN的方法(siaMAC、NetVLAD),并达到与BoW模型相当的性能。
  • 在马德里都市区数据集上,该方法从top-100候选中检索出494张图像,优于siaMAC的433张和NetVLAD的467张,较siaMAC提升约10%。
  • 在Gendarmenmarkt场景中,该方法从top-100候选中检索出1,049张图像,优于siaMAC(977张)和NetVLAD(1,002张),且重建精度相当。
  • 在ArtsQuad数据集(6,514张图像)上,该方法从top-100候选中检索出5,887张图像,从top-115中检索出6,030张,接近BoW性能,同时保持了高度对称的结果。
  • 该方法的重投影误差更低(0.58px–0.67px),且轨迹长度更长,表明在SfM流程中具有更好的对齐性和一致性。
  • 消融研究显示,结合网格重投影的掩码三元组损失显著提升了性能,尤其在纹理丰富的场景中;而BoW在无纹理场景中仍表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。