Skip to main content
QUICK REVIEW

[论文解读] Deep Object Co-Segmentation

Weihao Li, Omid Hosseini Jafari|arXiv (Cornell University)|Apr 17, 2018
Advanced Neural Network Applications参考文献 49被引用 14
一句话总结

本文提出深度物体共同分割(DOCS),一种基于孪生编码器-解码器卷积神经网络的方法,通过利用深层语义特征的相互关联性,联合分割图像对中的共有物体。该方法在多个数据集上达到最先进性能,并且在无需微调的情况下,能有效泛化到未见物体类别。

ABSTRACT

This work presents a deep object co-segmentation (DOCS) approach for segmenting common objects of the same class within a pair of images. This means that the method learns to ignore common, or uncommon, background stuff and focuses on objects. If multiple object classes are presented in the image pair, they are jointly extracted as foreground. To address this task, we propose a CNN-based Siamese encoder-decoder architecture. The encoder extracts high-level semantic features of the foreground objects, a mutual correlation layer detects the common objects, and finally, the decoder generates the output foreground masks for each image. To train our model, we compile a large object co-segmentation dataset consisting of image pairs from the PASCAL VOC dataset with common objects masks. We evaluate our approach on commonly used datasets for co-segmentation tasks and observe that our approach consistently outperforms competing methods, for both seen and unseen object classes.

研究动机与目标

  • 解决在存在多个物体类别且背景差异显著时,对图像对中的共有物体进行共同分割的挑战。
  • 开发一种端到端可训练的深度学习框架用于物体共同分割,避免依赖手工设计特征或后处理CRF优化。
  • 评估模型在训练数据中未出现的未见物体类别上的泛化能力,特别是在复杂、多类别场景中。
  • 构建并发布一个基于PASCAL VOC的大规模、高质量物体共同分割数据集,用于模型训练与基准测试。

提出的方法

  • 采用孪生编码器-解码器架构,其中两个相同的编码器分别从每张输入图像中提取深层语义特征。
  • 通过互相关层在瓶颈层计算两幅图像之间的局部特征相关性,突出显示语义相似性高的区域。
  • 解码分支通过转置卷积层将原始图像特征与相关性特征融合,重建出细节丰富的前景掩码。
  • 使用成对图像的真值物体掩码作为监督信号,端到端训练模型。
  • 从PASCAL VOC构建了一个新数据集,包含具有共享物体掩码的图像对,对应共有物体类别。
  • 通过在PASCAL类别子集上训练并在iCoseg的未见类别(如猎豹、熊猫和热气球)上测试,评估泛化性能。

实验结果

研究问题

  • RQ1纯卷积神经网络架构是否能在不依赖手工设计特征或CRF后处理的情况下,实现物体共同分割的最先进性能?
  • RQ2共同分割模型在训练过程中未见过的物体类别上,尤其在复杂多物体场景中,泛化能力如何?
  • RQ3互相关层在提升图像对之间特征匹配与分割精度方面有何贡献?
  • RQ4所提出方法是否在标准基准数据集上优于现有共同分割方法,包括具有高类内差异性和多样化背景的数据集?

主要发现

  • 在包含未见物体类别的iCoseg数据集上,DOCS达到84.2的平均Jaccard分数,优于所有四个对比的最先进方法。
  • 对于未见类别“棕熊”,DOCS的Jaccard分数达到91.5,显著高于次佳方法([11]为92.0,但本实验中DOCS为最优)。
  • 互相关层使Pascal VOC上的Jaccard分数提升14.6分(从49.9提升至64.5),在MSRC上提升10.9分(从72.0提升至82.9)。
  • 即使仅在10个PASCAL物体类别上训练,DOCS在iCoseg的未见类别上仍达到83.9的平均Jaccard分数,展现出强大的少样本泛化能力。
  • 在MSRC数据集上,DOCS达到82.9的Jaccard分数,比之前最佳方法高出10.9分。
  • 定性结果表明,DOCS即使在尺度、姿态、视角和背景存在大幅变化的情况下,也能准确分割共有物体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。