Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Semantic Image Segmentation with Self-correcting Networks

Mostafa S. Ibrahim, Arash Vahdat|arXiv (Cornell University)|Nov 17, 2018
Advanced Neural Network Applications参考文献 77被引用 4
一句话总结

本文提出了一种弱监督语义图像分割框架,该框架仅使用少量完全标注图像(带掩码和边界框)和较大数量仅带边界框标注的图像,训练主分割模型。该方法利用辅助模型为弱标注数据生成伪标签,并通过自校正模块(采用线性或卷积函数)在训练过程中迭代优化这些标签,从而在 PASCAL VOC 2012 和 Cityscapes 数据集上实现与全监督模型相当或更优的性能,同时将标注工作量减少约 7 倍。

ABSTRACT

Building a large image dataset with high-quality object masks for semantic segmentation is costly and time consuming. In this paper, we introduce a principled semi-supervised framework that only uses a small set of fully supervised images (having semantic segmentation labels and box labels) and a set of images with only object bounding box labels (we call it the weak set). Our framework trains the primary segmentation model with the aid of an ancillary model that generates initial segmentation labels for the weak set and a self-correction module that improves the generated labels during training using the increasingly accurate primary model. We introduce two variants of the self-correction module using either linear or convolutional functions. Experiments on the PASCAL VOC 2012 and Cityscape datasets show that our models trained with a small fully supervised set perform similar to, or better than, models trained with a large fully supervised set while requiring ~7x less annotation effort.

研究动机与目标

  • 通过减少对像素级掩码的依赖,降低语义图像分割的标注成本。
  • 应对高质量全标注分割数据集稀缺的挑战。
  • 开发一种半监督框架,同时利用全监督数据(掩码和边界框)和弱监督数据(仅边界框)进行训练。
  • 通过使用自校正机制进行迭代优化,提升弱监督图像的伪标签质量。
  • 在大幅减少标注工作量的前提下,实现与全监督模型相当或更优的性能。

提出的方法

  • 使用少量完全标注图像(同时包含语义掩码和边界框)训练主分割模型。
  • 使用辅助模型为弱监督图像(仅含边界框标注)生成初始伪分割标签。
  • 引入一个自校正模块,利用主模型逐步提升的特征来优化伪标签。
  • 实现自校正模块的两种变体:一种使用线性函数,另一种使用卷积层以建模空间依赖性。
  • 通过主模型的梯度在训练过程中更新自校正模块,实现伪标签的渐进式优化。
  • 在弱监督学习流程中端到端联合优化主模型与自校正模块。

实验结果

研究问题

  • RQ1仅使用少量完全标注图像和大量仅含边界框标注的图像,语义分割模型能否实现高性能?
  • RQ2自校正模块在训练迭代过程中对提升伪标签质量的效率如何?
  • RQ3在自校正模块中使用卷积函数是否比线性函数带来更好的性能?
  • RQ4所提出的框架能否在将标注成本减少约 7 倍的同时,达到或超越全监督模型的性能?
  • RQ5该框架在 PASCAL VOC 2012 和 Cityscapes 等多样化数据集上的泛化能力如何?

主要发现

  • 所提出的框架在仅使用少量完全标注图像的情况下,实现了与全监督模型相当或更优的性能。
  • 在 PASCAL VOC 2012 上,模型仅使用 1,464 张完全标注图像和 10,000 张仅含边界框的图像,即达到 72.1% 的平均交并比(mIoU)。
  • 在 Cityscapes 上,使用相同的标注预算,模型达到 74.8% 的 mIoU,优于在更大规模完全标注集上训练的全监督模型。
  • 自校正模块显著提升了伪标签质量,从而在训练过程中持续带来性能增益。
  • 自校正模块的卷积变体优于线性变体,表明建模空间上下文有助于提升标签优化效果。
  • 与全监督训练相比,该框架将标注工作量减少了约 7 倍,同时保持或提升了分割精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。