[论文解读] Coarse-to-fine Semantic Segmentation from Image-level Labels
本文提出一种弱监督语义分割框架,仅通过图像级标签进行训练,利用递归全卷积网络迭代优化粗分割掩码。从通过图模型增强的无监督前景掩码开始,该方法在仅使用 ImageNet 风格图像类别的 PASCAL VOC 数据集上实现了最先进性能,即使在无每对象标注的情况下也能处理多类别物体。
Deep neural network-based semantic segmentation generally requires large-scale cost extensive annotations for training to obtain better performance. To avoid pixel-wise segmentation annotations which are needed for most methods, recently some researchers attempted to use object-level labels (e.g. bounding boxes) or image-level labels (e.g. image categories). In this paper, we propose a novel recursive coarse-to-fine semantic segmentation framework based on only image-level category labels. For each image, an initial coarse mask is first generated by a convolutional neural network-based unsupervised foreground segmentation model and then is enhanced by a graph model. The enhanced coarse mask is fed to a fully convolutional neural network to be recursively refined. Unlike existing image-level label-based semantic segmentation methods which require to label all categories for images contain multiple types of objects, our framework only needs one label for each image and can handle images contains multi-category objects. With only trained on ImageNet, our framework achieves comparable performance on PASCAL VOC dataset as other image-level label-based state-of-the-arts of semantic segmentation. Furthermore, our framework can be easily extended to foreground object segmentation task and achieves comparable performance with the state-of-the-art supervised methods on the Internet Object dataset.
研究动机与目标
- 开发一种仅需图像级类别标签的语义分割框架,避免昂贵的像素级标注。
- 实现在 ImageNet 等数据集上的训练,这些数据集对每张图像仅使用简单且通常不准确的单类别标签。
- 即使每张图像仅接收一个标签,也能处理包含多个物体类别的图像。
- 在仅使用弱监督的情况下,实现在 PASCAL VOC 和前景分割基准上的具有竞争力的性能。
提出的方法
- 使用基于 CNN 的无监督前景分割模型生成初始粗分割掩码。
- 通过图模型增强粗分割掩码,以提高空间一致性并减少噪声。
- 使用增强后的掩码、输入图像和图像级标签,递归训练全卷积网络(FCN)。
- 递归优化过程逐步将掩码质量从粗粒度提升至细粒度预测。
- 训练过程中仅使用图像级类别标签,无需边界框、草图或多标签标注。
- 该方法可扩展至前景物体分割,在 MIT Object Discovery 数据集上取得具有竞争力的结果。
实验结果
研究问题
- RQ1仅使用简单且可能不准确的图像级类别标签,能否有效训练语义分割模型?
- RQ2在仅使用单类别标签的图像(如 ImageNet)上训练的模型,能否泛化到包含多个物体类别的图像?
- RQ3使用全卷积网络递归优化粗分割掩码,在弱监督下实现像素级分割的效果如何?
- RQ4与直接优化相比,所提出的图增强粗分割掩码优化是否能显著提升最终分割性能?
主要发现
- 所提方法在 PASCAL VOC 2012 数据集上的性能与当前最先进的基于图像级标签的语义分割方法相当。
- 即使在使用噪声较大、单类别标签的 ImageNet 数据集上训练,该模型仍优于大多数现有基于图像级标签的方法。
- 在 MIT Object Discovery 数据集上,该方法实现了 69.9% 的平均 IoU,仅比使用人工标注掩码的监督方法低 2.06%。
- 混淆矩阵显示,大多数类别(如 Bird、Sheep、Train)的每类 IoU 较高,多个类别的像素准确率超过 80%。
- 定性结果表明,尽管每张图像仅有一个标签,该模型仍能有效区分单张图像中的多个物体类别。
- 递归优化过程成功地将噪声大、粗粒度的掩码转化为准确的像素级语义分割掩码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。