Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Semantic Segmentation Based on Web Image Co-segmentation

Tong Shen, Guosheng Lin|arXiv (Cornell University)|May 25, 2017
Advanced Image and Video Retrieval Techniques参考文献 18被引用 11
一句话总结

本文提出了一种弱监督语义分割方法,利用网络图像共同分割生成基于图像级标签的高质量像素级掩码。通过从搜索引擎检索特定类别的图像并应用大规模共同分割,该框架训练一个掩码生成器和最终的分割网络,在 PASCAL VOC 2012 上实现了 56.9 mIoU 的性能,为仅使用图像级监督的弱监督方法中的最先进水平。

ABSTRACT

Training a Fully Convolutional Network (FCN) for semantic segmentation requires a large number of masks with pixel level labelling, which involves a large amount of human labour and time for annotation. In contrast, web images and their image-level labels are much easier and cheaper to obtain. In this work, we propose a novel method for weakly supervised semantic segmentation with only image-level labels. The method utilizes the internet to retrieve a large number of images and uses a large scale co-segmentation framework to generate masks for the retrieved images. We first retrieve images from search engines, e.g. Flickr and Google, using semantic class names as queries, e.g. class names in the dataset PASCAL VOC 2012. We then use high quality masks produced by co-segmentation on the retrieved images as well as the target dataset images with image level labels to train segmentation networks. We obtain an IoU score of 56.9 on test set of PASCAL VOC 2012, which reaches the state-of-the-art performance.

研究动机与目标

  • 通过仅使用图像级标签,解决语义分割中像素级掩码的高标注成本问题。
  • 消除对额外监督(如边界框、草图或显著性图)的依赖。
  • 开发一种可扩展的弱监督框架,利用互联网规模的网络图像和共同分割技术生成掩码。
  • 仅使用图像级监督在 PASCAL VOC 2012 上实现最先进性能。
  • 验证共同分割在为弱监督训练生成高质量伪掩码方面的有效性。

提出的方法

  • 使用 PASCAL VOC 2012 中的类别名称作为查询,从搜索引擎(Flickr 和 Google)检索大规模网络图像。
  • 对检索到的图像应用大规模共同分割框架,无需任何人工标注即可生成高质量像素级掩码。
  • 使用网络图像中共同分割得到的掩码作为伪真实标签,训练初始掩码生成器网络。
  • 利用掩码生成器为目标数据集(如 PASCAL VOC 2012)图像生成伪掩码。
  • 使用生成的伪掩码和目标数据集的图像级标签联合训练最终的分割网络,以优化预测结果。
  • 采用多尺度推理和 CRF 后处理以提高定位精度并减少噪声。

实验结果

研究问题

  • RQ1网络规模的共同分割能否有效生成用于弱监督语义分割的高质量伪掩码?
  • RQ2两阶段训练框架(先训练掩码生成器,再训练最终模型)是否能在仅使用图像级监督的情况下实现具有竞争力的性能?
  • RQ3与使用更强监督(如边界框、草图)的现有弱监督方法相比,所提方法表现如何?
  • RQ4多标签建模和后处理(如 CRF)对最终性能的贡献是什么?
  • RQ5当共同分割无法分离共现物体时,会引发哪些类型的失败案例?

主要发现

  • 所提方法在 PASCAL VOC 2012 测试集上实现了 56.9 的平均交并比(mIoU),创下仅使用弱监督的语义分割方法的新 SOTA 记录。
  • 消融实验表明,多标签模块将验证集上的性能从 53.3 mIoU 提升至 55.1 mIoU,证明其重要性。
  • 结合多尺度推理和 CRF 的最终模型在验证集上达到 56.4 mIoU,表明后处理能有效提升定位精度。
  • 该方法优于多个使用更强监督的基线模型,如点监督(46.1 mIoU)和仅使用图像级标签(49.8–51.2 mIoU),证明其有效性。
  • 失败案例主要源于物体共现(如椅子与餐桌共存)或低质量的共同分割掩码,导致过度或欠分割。
  • 该框架为完全弱监督,仅依赖图像级标签和网络图像共同分割,无需边界框、草图或像素级标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。