Skip to main content
QUICK REVIEW

[论文解读] Pointly-Supervised Instance Segmentation

Bowen Cheng, Omkar Parkhi|arXiv (Cornell University)|Apr 13, 2021
Advanced Neural Network Applications参考文献 59被引用 4
一句话总结

本文提出了一种简单的基于点的弱监督方案用于实例分割,其中标注者在每个物体的边界框内对10个随机点标注为前景或背景。令人惊讶的是,仅使用每个物体10个点进行训练的Mask R-CNN在COCO、PASCAL VOC、Cityscapes和LVIS数据集上达到了全监督性能的94%–98%,而标注速度比完整掩码标注快约5倍。作者进一步提出了Implicit PointRend,一种简化架构,通过点坐标和特征直接生成掩码预测,仅使用单点级损失即可实现优异性能。

ABSTRACT

We propose an embarrassingly simple point annotation scheme to collect weak supervision for instance segmentation. In addition to bounding boxes, we collect binary labels for a set of points uniformly sampled inside each bounding box. We show that the existing instance segmentation models developed for full mask supervision can be seamlessly trained with point-based supervision collected via our scheme. Remarkably, Mask R-CNN trained on COCO, PASCAL VOC, Cityscapes, and LVIS with only 10 annotated random points per object achieves 94%--98% of its fully-supervised performance, setting a strong baseline for weakly-supervised instance segmentation. The new point annotation scheme is approximately 5 times faster than annotating full object masks, making high-quality instance segmentation more accessible in practice. Inspired by the point-based annotation form, we propose a modification to PointRend instance segmentation module. For each object, the new architecture, called Implicit PointRend, generates parameters for a function that makes the final point-level mask prediction. Implicit PointRend is more straightforward and uses a single point-level mask loss. Our experiments show that the new module is more suitable for the point-based supervision.

研究动机与目标

  • 开发一种实用且高效的弱监督方案用于实例分割,以减少标注时间而不损失模型性能。
  • 证明少量点标注(每个物体10个点)可有效监督最先进的实例分割模型(如Mask R-CNN)。
  • 设计一种专为基于点的监督而优化的新实例分割模块Implicit PointRend,其结构更简单高效,摒弃了如粗粒度掩码预测和重要性采样等复杂组件。
  • 在真实标注时间约束下,评估基于点的弱监督在COCO、PASCAL VOC、LVIS和Cityscapes等多样化数据集上的性能表现。

提出的方法

  • 提出一种点标注方案:在每个物体的边界框内随机采样10个点,并标注为前景或背景,从而以极低的人工成本实现弱监督。
  • 通过插值方法仅在标注点位置计算掩码损失,将现有实例分割模型(如Mask R-CNN、PointRend、CondInst)适配为基于点级监督进行训练。
  • 提出Implicit PointRend,一种新型架构,通过可学习函数根据点坐标和图像级特征直接生成掩码预测,无需粗粒度掩码预测和重要性采样。
  • 使用位置编码表示点在物体框内的相对坐标,增强空间感知能力,提升性能,且无需额外监督。
  • 训练过程中仅使用单点级掩码损失,简化了流程,提高了与基于点的监督的兼容性。
  • 应用基于点的增强数据和自训练策略,进一步缩小弱监督与全监督模型之间的性能差距。

实验结果

研究问题

  • RQ1在物体边界框内随机采样并标注的少量点是否可作为实例分割模型的有效弱监督信号?
  • RQ2仅使用每个物体10个点标注进行训练的Mask R-CNN,在大规模数据集上能多大程度上达到全监督训练的性能?
  • RQ3能否设计一种专为基于点的监督而优化的新实例分割模块,使其在结构上比PointRend等现有架构更简单高效?
  • RQ4基于点的弱监督在COCO、PASCAL VOC、LVIS和Cityscapes等多样化数据集上的性能表现如何?

主要发现

  • 仅使用每个物体10个点标注进行训练的Mask R-CNN在COCO、PASCAL VOC、Cityscapes和LVIS数据集上达到了其全监督性能的94%–98%,表明该方法在多种数据集上具有强大的泛化能力。
  • 所提出的点标注方案相比基于多边形的掩码标注,将标注时间减少了约5倍,每张图像仅需16秒(7秒用于边界框标注 + 9秒用于10个点标注)。
  • 在基于点的监督下,Implicit PointRend的表现优于标准PointRend,且在全掩码监督下性能与之相当,尽管其架构更简单,不包含粗粒度掩码预测和重要性采样。
  • 引入相对坐标编码和图像级特征(如FPN p2)可使Implicit PointRend性能提升最多达1.7 AP,其中仅使用位置编码即可达到合理的基线性能。
  • 使用ResNet-50主干网络和3倍学习率调度,在全掩码监督下,模型在COCO上达到38.5 AP,优于CondInst,并接近PointRend的性能表现。
  • 结合基于点的自训练和数据增强策略,可进一步缩小弱监督与全监督之间的性能差距,表明该方法在有限标注资源下的实际部署具有巨大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。