Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Semantic Segmentation using Out-of-Distribution Data

Jungbeom Lee, Seung‐June Oh|arXiv (Cornell University)|Mar 8, 2022
Advanced Image and Video Retrieval Techniques被引用 6
一句话总结

本文提出W-OoD,一种弱监督语义分割方法,通过利用难样本的分布外(OoD)图像(例如,仅含铁轨的图像用于'火车'类别)来抑制虚假的背景关联。通过训练分类器以拒绝这些OoD样本,该方法提升了定位精度,在Pascal VOC 2012上实现了最先进性能,且额外标注成本极低。

ABSTRACT

Weakly supervised semantic segmentation (WSSS) methods are often built on pixel-level localization maps obtained from a classifier. However, training on class labels only, classifiers suffer from the spurious correlation between foreground and background cues (e.g. train and rail), fundamentally bounding the performance of WSSS. There have been previous endeavors to address this issue with additional supervision. We propose a novel source of information to distinguish foreground from the background: Out-of-Distribution (OoD) data, or images devoid of foreground object classes. In particular, we utilize the hard OoDs that the classifier is likely to make false-positive predictions. These samples typically carry key visual features on the background (e.g. rail) that the classifiers often confuse as foreground (e.g. train), so these cues let classifiers correctly suppress spurious background cues. Acquiring such hard OoDs does not require an extensive amount of annotation efforts; it only incurs a few additional image-level labeling costs on top of the original efforts to collect class labels. We propose a method, W-OoD, for utilizing the hard OoDs. W-OoD achieves state-of-the-art performance on Pascal VOC 2012.

研究动机与目标

  • 解决弱监督语义分割(WSSS)中的根本性局限:分类器学习到前景物体与背景线索之间的虚假关联(例如,火车与铁轨)。
  • 识别并利用分布外(OoD)数据——即不含前景类但包含混淆背景线索的图像——作为新型监督来源。
  • 通过利用标准数据集收集流程中自然产生的OoD数据,仅需少量额外图像级别标签,从而最小化标注成本。
  • 通过使用度量学习目标,训练分类器以区分分布内前景与难样本OoD样本,从而提升伪分割图的质量。
  • 证明即使仅使用少量难OoD样本(例如,每类1个),也能带来显著性能提升,使OoD数据成为密集标注的高性价比替代方案。

提出的方法

  • 从原始数据集筛选过程中未被选中的图像池中收集候选OoD图像,这些图像自然地排除了前景类别。
  • 通过选择预训练分类器对前景类别(如在仅含铁轨的图像上预测'火车')赋予高置信度的图像,来识别难样本OoD图像。
  • 应用人机协同的过滤步骤,移除任何意外包含前景物体的OoD图像,以确保干净的负样本监督。
  • 使用度量学习损失训练分类器,增加分布内样本与OoD样本之间的特征距离,促使模型拒绝虚假背景线索。
  • 将优化后的分类器集成到两阶段WSSS流程中:首先通过CAM变体生成伪分割掩码,然后使用这些改进的掩码训练分割网络。
  • 采用双损失策略:在分布内数据上使用标准交叉熵损失,同时在分布内和难OoD数据上使用对比距离损失($\mathcal{L}_{\text{d}}$),以稳定并提升特征判别能力。

实验结果

研究问题

  • RQ1能否有效利用分布外(OoD)数据作为监督来源,以减少弱监督语义分割中的虚假关联?
  • RQ2包含难OoD样本(即误导分类器预测为前景类的图像)如何影响伪分割掩码的质量?
  • RQ3在WSSS中实现显著性能提升所需的最低标注成本是多少?OoD数据能否以极低的标注开销大规模收集?
  • RQ4使用OoD数据是否能提升在多种物体类别上的泛化能力,特别是那些具有强烈背景关联的类别(如火车-铁轨、鸟-树)?
  • RQ5在OoD数据上使用度量学习是否能稳定训练过程,并改善分布内与虚假背景模式之间的特征解耦?

主要发现

  • W-OoD在Pascal VOC 2012上实现了最先进性能,优于现有基于图像级别标签的WSSS方法。
  • 每类仅添加一个难OoD图像,平均交并比(mIoU)即提升2.0个百分点,证明了极高的样本效率。
  • 该方法显著减少了虚假背景激活:t-SNE可视化显示,随着训练进行,分布内与OoD图像的特征逐渐可分。
  • 在OoD数据上应用度量学习损失$\mathcal{L}_{\text{d}}$显著提升了性能,mIoU从58.1%提升至60.1%。
  • 当$\mathcal{L}_{\text{d}}$应用于分布内数据时,mIoU在多次运行中的标准差从0.82降至0.33,表明训练稳定性显著提高。
  • 性能增益在具有强虚假关联的类别上最为明显(如'火车'、'飞机'、'船'),而'dining table'类别出现下降,可能由于真实标注掩码中包含桌面上的物体导致噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。