Skip to main content
QUICK REVIEW

[论文解读] The Devil is in the Points: Weakly Semi-Supervised Instance Segmentation via Point-Guided Mask Representation

Beomyoung Kim, Joonhyun Jeong|arXiv (Cornell University)|Mar 27, 2023
Image and Object Detection Techniques被引用 4
一句话总结

该论文提出了一种使用点标签的弱监督半监督实例分割框架,通过提升伪掩码质量并减少提议中的误报/漏报,实现更优性能。通过利用点标签进行自适应特征金字塔层级选择,并引入融合图像、粗略掩码和点输入的MaskRefineNet,该方法仅使用50%的全标注数据,在COCO上达到38.8%的AP,几乎与全监督方法(39.7%)性能相当。

ABSTRACT

In this paper, we introduce a novel learning scheme named weakly semi-supervised instance segmentation (WSSIS) with point labels for budget-efficient and high-performance instance segmentation. Namely, we consider a dataset setting consisting of a few fully-labeled images and a lot of point-labeled images. Motivated by the main challenge of semi-supervised approaches mainly derives from the trade-off between false-negative and false-positive instance proposals, we propose a method for WSSIS that can effectively leverage the budget-friendly point labels as a powerful weak supervision source to resolve the challenge. Furthermore, to deal with the hard case where the amount of fully-labeled data is extremely limited, we propose a MaskRefineNet that refines noise in rough masks. We conduct extensive experiments on COCO and BDD100K datasets, and the proposed method achieves promising results comparable to those of the fully-supervised model, even with 50% of the fully labeled COCO data (38.8% vs. 39.7%). Moreover, when using as little as 5% of fully labeled COCO data, our method shows significantly superior performance over the state-of-the-art semi-supervised learning method (33.7% vs. 24.9%). The code is available at https://github.com/clovaai/PointWSSIS.

研究动机与目标

  • 通过减少误报和漏报的提议来弥合半监督实例分割中的性能差距。
  • 利用低成本的点标签作为弱监督信号,指导提议过滤与掩码优化。
  • 克服在低数据场景下因监督不足导致掩码预测噪声较大的局限性。
  • 设计一种方法,在仅使用少量全标注数据和大量点标注数据的前提下,有效平衡提议质量与掩码精度。
  • 通过结合点监督与优化的掩码预测,在现实预算约束下实现高性能实例分割。

提出的方法

  • 利用点标签过滤实例提议,仅保留真正正样本提议,以减少误报。
  • 实施自适应特征金字塔层级选择,根据网络置信度分数将每个点分配至最可信的FPN特征层级。
  • 设计MaskRefineNet,输入为图像、粗略掩码和点,通过注意力机制融合方式优化噪声较大的掩码预测。
  • 在全标注数据上训练基础网络,随后利用过滤后的提议和优化后的掩码生成伪标签,用于目标网络的训练。
  • 采用两阶段训练流程:首先在全标注数据上训练基础模型,然后使用点引导的伪标签训练目标模型。
  • 从预测掩码中提取最小-最大点以生成边界框,用于在目标检测基准上进行评估。

实验结果

研究问题

  • RQ1点标签能否有效减少半监督实例分割中的误报和漏报提议?
  • RQ2在全标注数据稀缺的情况下,如何利用点标签提升掩码质量?
  • RQ3基于置信度的FPN层级自适应选择是否能提升掩码预测精度?
  • RQ4融合图像、粗略掩码和点输入的MaskRefineNet在多大程度上能降低伪掩码中的噪声?
  • RQ5所提方法是否能在显著减少全标注数据量的前提下,实现接近全监督学习的性能?

主要发现

  • 该方法仅使用50%的全标注数据,在COCO上达到38.8%的AP,而全监督方法为39.7%。
  • 当仅使用5%的全标注数据时,该方法达到33.7%的AP,显著优于当前最先进半监督方法(24.9% AP)。
  • 在COCO test-dev目标检测基准上,该方法超越了使用相同ResNet-50主干网络的现有弱监督半监督目标检测方法。
  • 定性结果表明,当同时使用图像、粗略掩码和点三种输入时,MaskRefineNet能有效分离重叠实例并去除噪声像素。
  • 在BDD100K数据集上,使用点标注数据训练的模型在小物体、大物体和遮挡物体上的鲁棒性优于无点监督的模型。
  • 消融实验表明,MaskRefineNet的三个输入均不可或缺:若省略点或粗略掩码,将导致分类错误和掩码边界不准确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。