[论文解读] ScribbleSup: Scribble-Supervised Convolutional Networks for Semantic Segmentation
本文提出ScribbleSup,一种弱监督语义分割方法,通过使用稀疏涂鸦标注而非密集像素级掩码来训练全卷积网络。通过将图模型中的标签传播与端到端深度学习联合优化,该方法实现了具有竞争力的性能——在PASCAL-CONTEXT上达到36.1%的mIoU,在VOC 2012上达到73.1%,表明低成本的涂鸦标注可显著提升准确率,且标注成本极低。
Large-scale data is of crucial importance for learning semantic segmentation models, but annotating per-pixel masks is a tedious and inefficient procedure. We note that for the topic of interactive image segmentation, scribbles are very widely used in academic research and commercial software, and are recognized as one of the most user-friendly ways of interacting. In this paper, we propose to use scribbles to annotate images, and develop an algorithm to train convolutional networks for semantic segmentation supervised by scribbles. Our algorithm is based on a graphical model that jointly propagates information from scribbles to unmarked pixels and learns network parameters. We present competitive object semantic segmentation results on the PASCAL VOC dataset by using scribbles as annotations. Scribbles are also favored for annotating stuff (e.g., water, sky, grass) that has no well-defined shape, and our method shows excellent results on the PASCAL-CONTEXT dataset thanks to extra inexpensive scribble annotations. Our scribble annotations on PASCAL VOC are available at http://research.microsoft.com/en-us/um/people/jifdai/downloads/scribble_sup
研究动机与目标
- 通过用更快、更用户友好的稀疏涂鸦标注替代密集掩码标注,减轻语义分割的标注负担。
- 开发一种利用涂鸦作为弱监督信号训练深度卷积网络的方法,弥合图像级与框级监督之间的差距。
- 评估涂鸦标注是否可作为掩码级标注的低成本替代方案,特别是针对边界模糊的'stuff'类别(如天空、草地和水体)。
- 证明大规模、低成本的涂鸦标注在与有限掩码级数据结合时,可通过半监督学习显著提升模型准确率。
提出的方法
- 该方法使用图模型基于空间接近度、外观相似性和语义上下文,将涂鸦标签传播至未标记像素。
- 通过统一损失函数联合优化标签传播与深度网络训练,该损失函数结合图模型的置信度分数与网络的分割预测结果。
- 使用图模型传播的标签端到端训练全卷积网络(FCN),并通过交替优化迭代精炼标签。
- 该框架在更新图模型的标签传播与通过FCN反向传播梯度以优化特征表示之间交替进行。
- 通过将少量掩码标注图像与来自不同数据集(如VOC 2007)的大规模涂鸦标注图像结合,实现半监督学习,以提升泛化能力。
- 该方法具有通用性,可适配其他弱监督信号,如框级或图像级标注。
实验结果
研究问题
- RQ1涂鸦标注能否作为训练语义分割模型的有效且高效替代方案,以替代密集掩码标注?
- RQ2与使用完整掩码标注训练的强监督模型相比,涂鸦监督模型的性能如何?
- RQ3对于'stuff'类别(如天空、草地和水体),涂鸦标注是否能优于其他弱监督范式(如框级或图像级标注)?
- RQ4在半监督设置下,大规模、低成本的涂鸦标注与有限掩码级数据结合时,能在多大程度上提升模型准确率?
- RQ5所提出的标签传播与深度网络训练的联合优化方法是否比标准弱监督方法更有效?
主要发现
- 在PASCAL VOC 2012验证集上,涂鸦监督方法达到73.1%的mIoU,仅使用10k VOC 2007涂鸦标注和11k掩码标注图像,接近强监督方法的最先进结果(超过74.8%)。
- 在PASCAL-CONTEXT数据集上,涂鸦监督方法达到36.1%的mIoU,仅比强监督基线(37.7%)下降1.6个百分点,表明在'stuff'类别上表现优异。
- 当将5k掩码标注的PASCAL-CONTEXT图像与10k VOC 2007涂鸦标注结合时,半监督方法达到42.0%的mIoU,优于BoxSup(40.5%),尽管仅使用其1/10的框级标注数量。
- 该方法在分割'stuff'类别(如天空、草地和水体)方面表现尤为突出,这些类别传统方法难以精确标注边界。
- 结果证实,涂鸦标注是规模化训练数据的高性价比方式,且更大规模的低成本涂鸦数据可显著提升模型准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。