[论文解读] Learning Semantic Segmentation with Diverse Supervision
本文提出了一种灵活的端到端深度学习框架,通过同时使用图像级、框级和像素级标注等多种监督类型,训练基于CNN的语义分割模型。通过为每种监督类型引入三个专用损失函数,该方法即使在像素级标注有限的情况下,也能显著提升分割性能,在PASCAL VOC 2012和SIFT-Flow基准上优于现有的弱监督方法。
Models based on deep convolutional neural networks (CNN) have significantly improved the performance of semantic segmentation. However, learning these models requires a large amount of training images with pixel-level labels, which are very costly and time-consuming to collect. In this paper, we propose a method for learning CNN-based semantic segmentation models from images with several types of annotations that are available for various computer vision tasks, including image-level labels for classification, box-level labels for object detection and pixel-level labels for semantic segmentation. The proposed method is flexible and can be used together with any existing CNN-based semantic segmentation networks. Experimental evaluation on the challenging PASCAL VOC 2012 and SIFT-flow benchmarks demonstrate that the proposed method can effectively make use of diverse training data to improve the performance of the learned models.
研究动机与目标
- 通过利用更易获取的弱监督信号,解决语义分割中像素级标注成本高且稀缺的问题。
- 开发一种统一的端到端训练框架,将图像级、框级和像素级等多种监督类型整合到单一分割模型中。
- 在不为所有训练数据提供完整像素级标注的情况下,提升基于CNN的语义分割模型的性能。
- 通过将监督机制与主干网络解耦,实现与任何现有基于CNN的分割架构的兼容性。
提出的方法
- 该方法采用多任务学习框架,包含三个独立的损失函数:一个用于图像级标签,一个用于框级标签,一个用于像素级标签。
- 对于框级监督,该方法通过在多个尺度强度下应用学习到的阈值策略,生成伪像素级掩码,避免依赖外部分割工具。
- 框级损失函数(公式3)通过基于网络预测的置信度分数对重叠区域进行加权,解决了重叠边界框中的标签模糊问题。
- 通过端到端联合训练分割头与所有监督类型,该框架可兼容任何现有的基于CNN的分割架构,如FCN或空洞卷积网络。
- 图像级监督采用软标签策略,使网络能够在不需精确定位的情况下学习类别特定的激活模式。
- 通过结合有限的像素级数据与丰富的图像级和框级标签,实现半监督学习,提升泛化能力和性能。
实验结果
研究问题
- RQ1单一深度学习框架能否有效结合图像级、框级和像素级标注,以提升语义分割性能?
- RQ2整合多种监督类型与仅使用像素级或弱监督数据相比,性能表现如何?
- RQ3从框级标注生成伪像素级掩码的最佳策略是什么,可最大限度减少误差和模糊性?
- RQ4所提出的方法在多大程度上能降低对昂贵像素级标注的依赖,同时保持高分割精度?
- RQ5在掩码生成中使用多个尺度阈值如何影响最终的分割性能?
主要发现
- 在半监督学习设置下,该方法在PASCAL VOC 2012测试集上实现了61.42的平均交并比(mIoU),优于现有弱监督方法。
- 仅使用1.4k像素级标注和9k框级标注,该方法达到了完全监督基线性能的98.75%,表现出极强的数据效率。
- 使用所提出的框级监督损失,模型在验证集上达到57.51 mIoU,优于GrabCut、MCG和硬分割等替代策略1.0–1.9个百分点。
- 消融实验表明,使用三个强度阈值进行掩码生成的性能优于单一阈值,mIoU提升达1.0–1.5个百分点。
- 当与FCN等标准架构结合时,该方法展现出强大的兼容性与性能增益,在多个基准上均表现出一致的改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。