Skip to main content
QUICK REVIEW

[论文解读] WebSeg: Learning Semantic Segmentation from Web Searches

Qibin Hou, Ming‐Ming Cheng|arXiv (Cornell University)|Mar 27, 2018
Advanced Neural Network Applications参考文献 32被引用 8
一句话总结

WebSeg 提出了一种弱监督语义分割方法,通过关键词搜索获取的网络图像进行学习,利用低层次线索(显著性、边缘、过分割)生成代理标注,并引入在线噪声过滤模块以处理标签噪声。该方法在 PASCAL VOC 2012 上实现了 57.0% 的 mIoU,且无需任何人工标注的掩码,展示了纯网络监督学习的强大性能。

ABSTRACT

In this paper, we improve semantic segmentation by automatically learning from Flickr images associated with a particular keyword, without relying on any explicit user annotations, thus substantially alleviating the dependence on accurate annotations when compared to previous weakly supervised methods. To solve such a challenging problem, we leverage several low-level cues (such as saliency, edges, etc.) to help generate a proxy ground truth. Due to the diversity of web-crawled images, we anticipate a large amount of 'label noise' in which other objects might be present. We design an online noise filtering scheme which is able to deal with this label noise, especially in cluttered images. We use this filtering strategy as an auxiliary module to help assist the segmentation network in learning cleaner proxy annotations. Extensive experiments on the popular PASCAL VOC 2012 semantic segmentation benchmark show surprising good results in both our WebSeg (mIoU = 57.0%) and weakly supervised (mIoU = 63.3%) settings.

研究动机与目标

  • 通过利用关键词搜索获取的免费网络图像,解决语义分割中像素级标注的高昂成本问题。
  • 克服在网页抓取图像中标签噪声的挑战,即与特定关键词相关的图像中可能包含不相关物体。
  • 开发一种方法,仅通过基于关键词的图像检索和无手动标注,实现对未见类别的零样本语义分割。
  • 设计一种轻量级、在线的噪声过滤机制,以提高模型对由启发式线索生成的噪声代理标注的鲁棒性。

提出的方法

  • 使用给定关键词的网络搜索结果,检索大规模且多样化的图像作为训练数据,无需任何人工标注的掩码。
  • 利用低层次线索——显著性图(DSS)、边缘图(RCF)和过分割区域(MCG)——生成代理真实标签,这些线索与类别无关且无需训练。
  • 通过在过分割区域上对显著性值取平均,构建代理标注,为每张图像生成伪标注。
  • 在深度网络(如 DeepLab)中引入一个轻量级分支作为在线噪声过滤模块,动态抑制在噪声或无关区域上的预测。
  • 使用噪声代理标注端到端训练分割网络,同时过滤模块在优化过程中学习拒绝误报。
  • 通过在两阶段训练设置中结合过滤模块与图像级监督,实现弱监督,显著提升性能。

实验结果

研究问题

  • RQ1深度学习模型能否仅通过基于关键词的网络图像检索和无任何人工标注掩码,学习到未见物体类别的准确语义分割?
  • RQ2尽管网络数据中存在固有的标签噪声,如何有效利用从低层次线索(显著性、边缘、区域)生成的代理标注来训练分割模型?
  • RQ3在训练噪声较大的网络监督数据时,在线噪声过滤机制能在多大程度上提升模型的泛化能力和性能?
  • RQ4所提出的方法能否在标准基准(如 PASCAL VOC 2012)上与完全监督或弱监督基线方法相比达到具有竞争力的性能?

主要发现

  • WebSeg 仅使用网络图像和无任何人工标注掩码,在 PASCAL VOC 2012 基准上实现了 57.0% 的平均交并比(mIoU),展示了强大的零样本泛化能力。
  • 在弱监督设置下(如图像级标签),WebSeg 性能达到 63.3% mIoU,优于所有其他最先进方法在大多数类别上的表现。
  • 在线噪声过滤模块显著提升了模型鲁棒性,使模型能够从大规模、噪声较大的网络数据中学习,同时抑制在无关区域上的错误预测。
  • 该方法具有类别无关性:低层次线索(显著性、边缘、区域)无需微调或重新训练即可使用,可实现对新类别的快速适应。
  • 消融实验表明,代理标注生成和噪声过滤机制对性能均至关重要,任一组件的消融均导致 mIoU 显著下降。
  • 该方法在弱监督设置下达到最先进性能,其中最佳变体(WebSeg$^{oldsymbol{ op}}$)在 21 个类别中的 18 个上超越了所有先前方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。