Skip to main content
QUICK REVIEW

[论文解读] Object cosegmentation using deep Siamese network

Prerana Mukherjee, Brejesh Lall|arXiv (Cornell University)|Mar 7, 2018
Advanced Neural Network Applications参考文献 24被引用 18
一句话总结

该论文提出了一种端到端的深度学习框架用于目标共分割,通过将问题建模为聚类问题,并利用孪生网络学习跨目标提议的深度特征相似性。该方法在iCoseg和MSRC数据集上取得了最先进性能,使用MCG生成的提议时,Jaccard相似度达到0.66,mAP达到0.84,并基于学习到的相似性分数生成视觉摘要。

ABSTRACT

Object cosegmentation addresses the problem of discovering similar objects from multiple images and segmenting them as foreground simultaneously. In this paper, we propose a novel end-to-end pipeline to segment the similar objects simultaneously from relevant set of images using supervised learning via deep-learning framework. We experiment with multiple set of object proposal generation techniques and perform extensive numerical evaluations by training the Siamese network with generated object proposals. Similar objects proposals for the test images are retrieved using the ANNOY (Approximate Nearest Neighbor) library and deep semantic segmentation is performed on them. Finally, we form a collage from the segmented similar objects based on the relative importance of the objects.

研究动机与目标

  • 为解决在缺乏前景对象先验知识的情况下,从多幅图像中分割出相似对象的挑战。
  • 利用共性先验和图像的联合处理,提升在类内差异与噪声下的分割鲁棒性。
  • 开发一个端到端流程,结合孪生网络进行相似性学习与全卷积网络进行语义分割。
  • 基于相对相似性与重要性,生成共分割对象的视觉摘要。

提出的方法

  • 使用对比损失函数,在成对的目标提议上训练共享权重的孪生网络,以学习判别性深度特征。
  • 对比损失确保相同类别对象(相似图块)在嵌入空间中映射得更近,而不同类别的则被推远。
  • 通过多种技术(EdgeBoxes、Selective Search、MCG、显著性提议)生成目标提议,并输入到训练好的孪生网络中,提取256维特征向量。
  • 利用ANNOY库执行相似性搜索,基于特征空间中的欧氏距离,从测试图像中检索最近邻提议。
  • 使用全卷积网络(FCN)对检索到的相似提议应用语义分割,实现像素级分割。
  • 通过将最相似的对象置于中心、保持相对距离,并添加合成背景以保证视觉一致性,构建视觉拼贴图。

实验结果

研究问题

  • RQ1孪生网络能否有效学习编码共性先验的深度特征表示,以实现目标共分割?
  • RQ2目标提议生成方法的选择如何影响共分割流程的性能?
  • RQ3所提出方法是否能在无需微调的情况下泛化到未见对象类别,仅使用预训练特征?
  • RQ4视觉拼贴图生成在反映共分割对象相对相似性与重要性方面是否有效?

主要发现

  • 当使用MCG生成的提议,在70%训练集与100%测试集上训练时,该方法在MSRC数据集上实现了0.66的Jaccard相似度与0.84的mAP。
  • 在iCoseg数据集上,当使用MCG提议在80%训练集与100%测试集上训练时,该方法实现了0.654的Jaccard相似度与0.81的mAP。
  • 在非目标类别(如Pascal、动物)上预训练的孪生网络,能很好地泛化到目标类别(如iCoseg、MSRC),仅需极少微调,展现出强大的零样本泛化能力。
  • MCG生成的目标提议在两个数据集上均表现最佳,优于EdgeBoxes、Selective Search和基于显著性的提议。
  • 视觉拼贴图生成有效反映了相似性层级,最相似的对象被置于中心,且视觉上保持一致。
  • 每张图像的特征提取推理时间低于100ms,使该方法适用于实时应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。