Skip to main content
QUICK REVIEW

[论文解读] Extracting Deformation-Aware Local Features by Learning to Deform

Guilherme Potje, Renato Martins|arXiv (Cornell University)|Nov 20, 2021
3D Surveying and Cultural Heritage参考文献 49被引用 4
一句话总结

该论文提出DEAL,一种形变感知的局部特征描述子,通过空间变换器与极坐标采样联合学习空间形变与特征提取,实现对非刚性形变、旋转和尺度的不变性。在模拟等距形变下端到端训练,DEAL在真实与合成可变形物体基准测试中优于当前最先进的人工设计及学习型图像与RGB-D描述子。

ABSTRACT

Despite the advances in extracting local features achieved by handcrafted and learning-based descriptors, they are still limited by the lack of invariance to non-rigid transformations. In this paper, we present a new approach to compute features from still images that are robust to non-rigid deformations to circumvent the problem of matching deformable surfaces and objects. Our deformation-aware local descriptor, named DEAL, leverages a polar sampling and a spatial transformer warping to provide invariance to rotation, scale, and image deformations. We train the model architecture end-to-end by applying isometric non-rigid deformations to objects in a simulated environment as guidance to provide highly discriminative local features. The experiments show that our method outperforms state-of-the-art handcrafted, learning-based image, and RGB-D descriptors in different datasets with both real and realistic synthetic deformable objects in still images. The source code and trained model of the descriptor are publicly available at https://www.verlab.dcc.ufmg.br/descriptors/neurips2021.

研究动机与目标

  • 解决现有局部描述子在真实场景中对非刚性形变缺乏不变性的问题。
  • 开发一种仅利用RGB图像提取鲁棒、形变感知特征的方法,无需依赖深度数据。
  • 通过端到端训练学习上下文形变信息,提升可变形物体的匹配性能。
  • 在仅使用静态RGB图像的前提下,实现与基于RGB-D的SOTA描述子相当的高效性与判别能力。
  • 在真实世界应用(如物体检索与非刚性跟踪)中展示有效性。

提出的方法

  • 采用双分支网络架构:一个特征提取分支与一个基于空间变换器的形变引导形变校正分支。
  • 在模拟环境中使用等距非刚性形变生成训练数据,引导网络学习形变不变特征。
  • 对形变后的特征图应用极坐标采样,实现旋转与尺度不变性。
  • 使用对比损失端到端训练整个网络,以优化形变下的对应匹配性能。
  • 利用空间变换器预测形变场,在特征提取前对局部块进行对齐。
  • 采用类似Siamese的训练设置,使用正负关键点对学习判别性描述子。

实验结果

研究问题

  • RQ1基于深度学习的局部描述子是否仅使用RGB图像且无深度监督即可实现对非刚性形变的不变性?
  • RQ2与传统描述子相比,使用模拟形变进行端到端训练在提升特征匹配鲁棒性方面有何优势?
  • RQ3基于单张RGB图像的描述子在非刚性场景下能在多大程度上达到基于RGB-D的SOTA描述子的性能?
  • RQ4与现有学习型及人工设计的描述子相比,所提出的架构在真实可变形物体数据集上的效率与准确性如何?
  • RQ5所学习的形变感知特征是否能泛化到真实世界应用(如物体检索与非刚性跟踪)?

主要发现

  • DEAL在所有评估的手工设计与学习型图像描述子中表现最优,包括GeoBit与DaLI等SOTA方法,在非刚性物体匹配基准测试中表现卓越。
  • 在HPatches数据集的非刚性序列上,DEAL在RANSAC内点中的匹配得分为0.46,优于DaLI(0.32),并达到与GeoBit(0.46)相当的水平,尽管仅使用RGB数据。
  • 在K ≤ 10的物体检索任务中,DEAL达到最高的检索准确率,甚至超越了SOTA的DELF描述子。
  • 在非刚性跟踪任务中,DEAL的LPIPS得分为0.24,RANSAC内点数为0.46,与最佳性能方法(包括GeoBit)相当,且优于DaLI与Log-Polar。
  • 定性结果表明,即使在极端形变与视角变化下,DEAL仍能保持稳定的对应匹配,而DaLI等竞争方法在类似条件下失效。
  • 源代码与训练模型已公开发布于 https://www.verlab.dcc.ufmg.br/descriptors/neurips2021,支持可复现性与进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。