Skip to main content
QUICK REVIEW

[论文解读] Epipolar-Guided Deep Object Matching for Scene Change Detection

Kento Doi, Ryuhei Hamaguchi|arXiv (Cornell University)|Jul 30, 2020
Advanced Image and Video Retrieval Techniques参考文献 44被引用 6
一句话总结

本文提出一种基于对象的变更检测网络(OBJ-CDNet),结合了对极几何引导的深度图匹配(EGMNet),仅使用对象级标注即可实现鲁棒、视角不变的场景变更检测。通过将对极几何融入图匹配,该方法在无需精确图像对齐的情况下实现了准确的对象对应关系与像素级变更检测,在合成数据集和真实世界数据集上均显著优于基于像素的基线方法,尤其在大视角变化下表现突出。

ABSTRACT

This paper describes a viewpoint-robust object-based change detection network (OBJ-CDNet). Mobile cameras such as drive recorders capture images from different viewpoints each time due to differences in camera trajectory and shutter timing. However, previous methods for pixel-wise change detection are vulnerable to the viewpoint differences because they assume aligned image pairs as inputs. To cope with the difficulty, we introduce a deep graph matching network that establishes object correspondence between an image pair. The introduction enables us to detect object-wise scene changes without precise image alignment. For more accurate object matching, we propose an epipolar-guided deep graph matching network (EGMNet), which incorporates the epipolar constraint into the deep graph matching layer used in OBJCDNet. To evaluate our network's robustness against viewpoint differences, we created synthetic and real datasets for scene change detection from an image pair. The experimental results verified the effectiveness of our network.

研究动机与目标

  • 为解决移动摄像头场景中因动态相机轨迹和快门时间导致难以精确对齐图像而引起的视角变化挑战。
  • 通过仅使用对象级变更监督实现端到端学习,降低对昂贵像素级标注的依赖。
  • 通过将对极几何整合到深度图匹配中,提升在大视角差异下的对象匹配鲁棒性。
  • 创建并发布首个大规模、公开可用的合成与真实世界数据集,用于基准测试基于对象的场景变更检测。

提出的方法

  • 该方法使用目标检测网络从输入图像对中生成边界框和感兴趣区域(RoI)特征。
  • 从检测到的边界框构建对象图,其中节点表示对象,边通过Delaunay三角剖分编码空间关系以构建几何结构。
  • 一个对极引导的深度图匹配层计算对象图之间的亲和矩阵,通过引入基础矩阵,利用归一化的对极距离强制实现几何一致性。
  • 一个可学习的注意力机制融合匹配后的对象特征,以预测像素级语义变更掩码,而无需像素级真实标签。
  • 网络通过仅使用对象级变更标注和边界框监督进行端到端训练,支持迁移学习以提升性能。
  • 该方法扩展为使用预训练的语义分割头(如基于Cityscapes的模型),以进一步提升像素级检测精度。

实验结果

研究问题

  • RQ1在移动摄像头场景中,结合对极约束的深度图匹配是否能提升在大视角变化下的对象对应关系鲁棒性?
  • RQ2在训练网络以实现准确的像素级变更检测时,对象级标注在多大程度上可以替代像素级标注?
  • RQ3将几何约束(对极几何)整合到图匹配中,对匹配准确率和变更检测性能有何影响?
  • RQ4统一的网络架构是否能够仅通过对象级监督实现鲁棒的对象匹配与高精度的像素级变更检测?

主要发现

  • EGMNet 采用 Delaunay 图结构在对象匹配准确率上优于全连接图,证明了对象间几何关系的重要性。
  • 对极约束显著提升了匹配性能,EGMNet(FC/DT)在合成与真实数据集上均持续优于非对极基线方法。
  • OBJ-CDNet 配合注意力机制在像素级变更检测准确率(mIoU)方面与完全监督的最先进方法相当,即使未使用像素级标注。
  • OBJ-CDSegNet(采用预训练分割头)在 CARLA-OBJCD 数据集上,于大视角差异下优于三个完全监督基线中的两个。
  • 当使用真实边界框时,EGMNet 达到最先进性能,表明未来在对象检测性能提升后具有巨大改进潜力。
  • 该方法在具有挑战性的场景(如移动车辆、遮挡)中成功检测到场景变更,并在显著视角偏移下保持鲁棒性,而标准像素级方法则表现不佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。