Skip to main content
QUICK REVIEW

[论文解读] Weakly-Supervised Semantic Segmentation with Image-Level Labels: from Traditional Models to Foundation Models

Zhaozheng Chen, Qianru Sun|arXiv (Cornell University)|Oct 19, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

本文综述了仅使用图像级别标签的传统弱监督语义分割(WSSS)方法,并探讨了将分割一切模型(SAM)应用于两种场景下的WSSS:文本提示和零样本学习。结果表明,SAM显著优于传统方法,生成的伪掩码质量极高,尤其在户外场景和常见物体类别中,其质量甚至超过人工标注。

ABSTRACT

The rapid development of deep learning has driven significant progress in image semantic segmentation - a fundamental task in computer vision. Semantic segmentation algorithms often depend on the availability of pixel-level labels (i.e., masks of objects), which are expensive, time-consuming, and labor-intensive. Weakly-supervised semantic segmentation (WSSS) is an effective solution to avoid such labeling. It utilizes only partial or incomplete annotations and provides a cost-effective alternative to fully-supervised semantic segmentation. In this journal, our focus is on the WSSS with image-level labels, which is the most challenging form of WSSS. Our work has two parts. First, we conduct a comprehensive survey on traditional methods, primarily focusing on those presented at premier research conferences. We categorize them into four groups based on where their methods operate: pixel-wise, image-wise, cross-image, and external data. Second, we investigate the applicability of visual foundation models, such as the Segment Anything Model (SAM), in the context of WSSS. We scrutinize SAM in two intriguing scenarios: text prompting and zero-shot learning. We provide insights into the potential and challenges of deploying visual foundational models for WSSS, facilitating future developments in this exciting research area.

研究动机与目标

  • 提供仅使用图像级别标签的传统WSSS方法的全面综述,按操作层级分类:像素级、图像级、跨图像级和外部数据。
  • 研究视觉基础模型(特别是SAM)在有限监督下进行弱监督语义分割的可行性和性能。
  • 在两种实际场景中评估SAM:使用Grounded DINO生成边界框的文本输入,以及使用RAM进行类别标记的零样本学习,用于生成伪掩码。
  • 分析基础模型在WSSS中的局限性和失败案例,特别是标注策略差异和复杂室内场景的影响。
  • 识别部署基础模型于弱监督分割中的关键挑战与未来研究方向,包括模型鲁棒性与标注标准化。

提出的方法

  • 根据操作层级将传统WSSS方法分为四类:像素级(如损失函数、局部补丁)、图像级(如对抗性学习、一致性正则化)、跨图像级(如多图像对比)和外部数据级(如显著性图、分布外数据)。
  • 使用Grounded DINO模型从文本输入中的类别标签生成目标边界框,随后将这些边界框作为提示输入SAM以生成分割掩码。
  • 在零样本设置中,使用Recognise Anything Model (RAM)从图像特征中预测类别标签,随后将这些标签作为文本提示输入SAM以生成掩码,无需任何类别特定的微调。
  • 应用SAM的基于提示的分割框架,结合文本提示与零样本类别嵌入生成伪掩码,利用其在SA-1B数据集上的大规模预训练优势。
  • 在VOC数据集上进行逐类别分析与失败案例分析,评估掩码质量,重点关注mIoU以及模型输出与数据集标注之间的视觉差异。
  • 通过mIoU指标比较不同方法的伪掩码质量,并结合定性分析,揭示失败原因主要源于定位/标记模型错误或标注策略不匹配。
Figure 1 : The performance of recent WSSS works (CONTA [ 87 ] , IRN [ 1 ] , ReCAM [ 12 ] , AMN [ 41 ] , LPCAM [ 11 ] , and CLIP-ES [ 51 ] ) and an evaluation of foundation models on MS COCO [ 50 ] val set.
Figure 1 : The performance of recent WSSS works (CONTA [ 87 ] , IRN [ 1 ] , ReCAM [ 12 ] , AMN [ 41 ] , LPCAM [ 11 ] , and CLIP-ES [ 51 ] ) and an evaluation of foundation models on MS COCO [ 50 ] val set.

实验结果

研究问题

  • RQ1仅使用图像级别标签的传统WSSS方法在不同操作层级(像素级、图像级、跨图像级、外部数据)下的性能与设计有何差异?
  • RQ2当通过文本提示或零样本方式输入时,分割一切模型(SAM)能否有效生成高质量的伪掩码用于弱监督语义分割?
  • RQ3SAM在WSSS中的关键失败模式是什么?其与管道中所用定位模型(如Grounded DINO)和标记模型(如RAM)性能的关系如何?
  • RQ4如VOC等基准数据集的标注策略在多大程度上影响伪掩码质量的评估,特别是对复杂或模糊类别?
  • RQ5基础模型如SAM在多大程度上能超越传统WSSS方法?在实际部署中仍面临哪些挑战?

主要发现

  • SAM(文本输入)和SAM(零样本)在伪掩码质量上显著优于传统WSSS方法,其mIoU得分常接近或超过全监督模型。
  • SAM(文本输入)在与动物和交通工具相关的类别上表现优异,尤其在背景较简单的户外场景中,得益于更强的泛化能力和提示对齐能力。
  • 在室内场景和特定物体类别(如餐桌、自行车)中性能下降,主要由于背景复杂以及标注策略不匹配(如排除空心轮毂部分或包含桌面物品)。
  • 失败案例通常归因于定位模型(Grounded DINO)或标记模型(RAM)的错误,而非SAM本身,表明整个流程的鲁棒性依赖于上游组件。
  • 逐类别分析显示,SAM(文本输入)和SAM(零样本)生成的伪掩码在边界准确性和完整性方面,经常超过人工标注掩码的质量。
  • 本研究揭示了模型分割结果与数据集标注协议之间存在关键差距,强调了在评估中采用标准化、更一致的标注实践的必要性。
Figure 2 : The pipeline of traditional methods and foundation models in WSSS. The dashed line means an optional step.
Figure 2 : The pipeline of traditional methods and foundation models in WSSS. The dashed line means an optional step.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。