[论文解读] The Devil is in the Points: Weakly Semi-Supervised Instance Segmentation via Point-Guided Mask Representation
该论文提出了一种使用点标签的弱监督半监督实例分割框架,通过提升伪掩码质量并减少提议中的误报/漏报,实现更优性能。通过利用点标签进行自适应特征金字塔层级选择,并引入融合图像、粗略掩码和点输入的MaskRefineNet,该方法仅使用50%的全标注数据,在COCO上达到38.8%的AP,几乎与全监督方法(39.7%)性能相当。
In this paper, we introduce a novel learning scheme named weakly semi-supervised instance segmentation (WSSIS) with point labels for budget-efficient and high-performance instance segmentation. Namely, we consider a dataset setting consisting of a few fully-labeled images and a lot of point-labeled images. Motivated by the main challenge of semi-supervised approaches mainly derives from the trade-off between false-negative and false-positive instance proposals, we propose a method for WSSIS that can effectively leverage the budget-friendly point labels as a powerful weak supervision source to resolve the challenge. Furthermore, to deal with the hard case where the amount of fully-labeled data is extremely limited, we propose a MaskRefineNet that refines noise in rough masks. We conduct extensive experiments on COCO and BDD100K datasets, and the proposed method achieves promising results comparable to those of the fully-supervised model, even with 50% of the fully labeled COCO data (38.8% vs. 39.7%). Moreover, when using as little as 5% of fully labeled COCO data, our method shows significantly superior performance over the state-of-the-art semi-supervised learning method (33.7% vs. 24.9%). The code is available at https://github.com/clovaai/PointWSSIS.
研究动机与目标
- 通过减少误报和漏报的提议来弥合半监督实例分割中的性能差距。
- 利用低成本的点标签作为弱监督信号,指导提议过滤与掩码优化。
- 克服在低数据场景下因监督不足导致掩码预测噪声较大的局限性。
- 设计一种方法,在仅使用少量全标注数据和大量点标注数据的前提下,有效平衡提议质量与掩码精度。
- 通过结合点监督与优化的掩码预测,在现实预算约束下实现高性能实例分割。
提出的方法
- 利用点标签过滤实例提议,仅保留真正正样本提议,以减少误报。
- 实施自适应特征金字塔层级选择,根据网络置信度分数将每个点分配至最可信的FPN特征层级。
- 设计MaskRefineNet,输入为图像、粗略掩码和点,通过注意力机制融合方式优化噪声较大的掩码预测。
- 在全标注数据上训练基础网络,随后利用过滤后的提议和优化后的掩码生成伪标签,用于目标网络的训练。
- 采用两阶段训练流程:首先在全标注数据上训练基础模型,然后使用点引导的伪标签训练目标模型。
- 从预测掩码中提取最小-最大点以生成边界框,用于在目标检测基准上进行评估。
实验结果
研究问题
- RQ1点标签能否有效减少半监督实例分割中的误报和漏报提议?
- RQ2在全标注数据稀缺的情况下,如何利用点标签提升掩码质量?
- RQ3基于置信度的FPN层级自适应选择是否能提升掩码预测精度?
- RQ4融合图像、粗略掩码和点输入的MaskRefineNet在多大程度上能降低伪掩码中的噪声?
- RQ5所提方法是否能在显著减少全标注数据量的前提下,实现接近全监督学习的性能?
主要发现
- 该方法仅使用50%的全标注数据,在COCO上达到38.8%的AP,而全监督方法为39.7%。
- 当仅使用5%的全标注数据时,该方法达到33.7%的AP,显著优于当前最先进半监督方法(24.9% AP)。
- 在COCO test-dev目标检测基准上,该方法超越了使用相同ResNet-50主干网络的现有弱监督半监督目标检测方法。
- 定性结果表明,当同时使用图像、粗略掩码和点三种输入时,MaskRefineNet能有效分离重叠实例并去除噪声像素。
- 在BDD100K数据集上,使用点标注数据训练的模型在小物体、大物体和遮挡物体上的鲁棒性优于无点监督的模型。
- 消融实验表明,MaskRefineNet的三个输入均不可或缺:若省略点或粗略掩码,将导致分类错误和掩码边界不准确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。