Skip to main content
QUICK REVIEW

[论文解读] Show, Match and Segment: Joint Weakly Supervised Learning of Semantic Matching and Object Co-segmentation

Yunchun Chen, Yen‐Yu Lin|arXiv (Cornell University)|Jun 13, 2019
Advanced Neural Network Applications参考文献 95被引用 4
一句话总结

该论文提出了一种弱监督、端到端可训练的双流网络,通过利用跨任务一致性,联合优化语义匹配与目标共同分割。通过使用预测掩码抑制匹配中的背景杂波,并利用密集对应关系在分割中强制实现几何一致性,该方法仅使用图像级监督就在五个基准数据集上取得了最先进性能。

ABSTRACT

We present an approach for jointly matching and segmenting object instances of the same category within a collection of images. In contrast to existing algorithms that tackle the tasks of semantic matching and object co-segmentation in isolation, our method exploits the complementary nature of the two tasks. The key insights of our method are two-fold. First, the estimated dense correspondence fields from semantic matching provide supervision for object co-segmentation by enforcing consistency between the predicted masks from a pair of images. Second, the predicted object masks from object co-segmentation in turn allow us to reduce the adverse effects due to background clutters for improving semantic matching. Our model is end-to-end trainable and does not require supervision from manually annotated correspondences and object masks. We validate the efficacy of our approach on five benchmark datasets: TSS, Internet, PF-PASCAL, PF-WILLOW, and SPair-71k, and show that our algorithm performs favorably against the state-of-the-art methods on both semantic matching and object co-segmentation tasks.

研究动机与目标

  • 解决孤立语义匹配与目标共同分割方法因背景杂波和对象覆盖不全而带来的局限性。
  • 利用语义匹配与目标共同分割的互补性,提升两项任务的性能。
  • 开发一种仅需弱图像级监督(即包含共同对象的图像对)的端到端可训练模型,避免昂贵的人工标注。
  • 引入跨网络一致性损失,强制在图像对之间实现预测掩码与密集对应关系在几何与外观上的一致性。
  • 通过联合优化提升对类内差异、尺度、姿态和视角变化的鲁棒性。

提出的方法

  • 该方法采用双流网络:一个流用于预测语义匹配的密集对应场,另一个流用于预测共同分割的前景目标掩码。
  • 引入跨网络一致性损失,强制一个流的预测掩码与另一流的密集对应关系在几何上保持一致。
  • 在语义匹配中,应用循环一致性损失以提高预测图像变换的几何合理性。
  • 在目标共同分割中,使用截止阈值 $m$ 的感知对比损失增强图像间前景外观的相似性,同时强制前景-背景差异性。
  • 模型仅使用图像级监督进行端到端训练,无需标注的关键点对应关系或目标掩码。
  • 通过DenseCRF、Otsu方法或GrabCut进行后处理以优化分割掩码,不同方法间性能差异极小。

实验结果

研究问题

  • RQ1联合学习语义匹配与目标共同分割是否能相比孤立方法提升两项任务的性能?
  • RQ2通过预测掩码与密集对应关系的跨任务监督,如何增强对背景杂波和外观变化的鲁棒性?
  • RQ3跨网络一致性损失在弱监督设置下在多大程度上提升了几何与外观一致性?
  • RQ4模型对感知对比损失中的截止阈值 $m$ 等超参数的选择有多敏感?
  • RQ5弱监督、端到端可训练的框架是否能在无手动标注的情况下实现最先进性能?

主要发现

  • 所提方法在五个基准数据集(TSS、Internet、PF-PASCAL、PF-WILLOW 和 SPair-71k)上,对语义匹配与目标共同分割均实现了最先进性能。
  • 当截止阈值 $m$ 设为 2 时,感知对比损失达到最优性能,提升了精确率 $\mathcal{P}$ 与交并比 $\mathcal{J}$;当 $m$ 增加至 5 或 10 时性能下降。
  • 关闭任一损失组件(如循环一致性、感知对比损失或跨网络一致性损失)均导致性能显著下降,证实了各损失项的贡献。
  • 当任一损失的超参数设置过高(如 1,000)时,该损失项会主导训练目标,导致性能下降,表明对超参数调优具有敏感性。
  • 模型在GTX 1080 GPU上平均每个图像处理时间为21秒,处理TSS数据集的800张图像总推理时间为280分钟。
  • 使用DenseCRF、Otsu方法或GrabCut进行后处理性能相近,表明模型的分割输出在不同优化方法下均具有鲁棒性与稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。