Skip to main content
QUICK REVIEW

[论文解读] Weakly-supervised Instance Segmentation via Class-agnostic Learning with Salient Images

Xinggang Wang, Jiapei Feng|arXiv (Cornell University)|Apr 4, 2021
Advanced Neural Network Applications参考文献 57被引用 7
一句话总结

本文提出BoxCaseg,一种弱监督实例分割方法,利用与类别无关的显著物体检测作为辅助记忆,以提升仅使用边界框标注的分割性能。通过在7,991张显著图像和边界框标注图像上联合训练,并采用合并与丢弃策略优化预测,该方法在PASCAL VOC上的性能与全监督Mask R-CNN相当,在COCO上超越了先前最先进方法,且仅使用极少的弱监督信号。

ABSTRACT

Humans have a strong class-agnostic object segmentation ability and can outline boundaries of unknown objects precisely, which motivates us to propose a box-supervised class-agnostic object segmentation (BoxCaseg) based solution for weakly-supervised instance segmentation. The BoxCaseg model is jointly trained using box-supervised images and salient images in a multi-task learning manner. The fine-annotated salient images provide class-agnostic and precise object localization guidance for box-supervised images. The object masks predicted by a pretrained BoxCaseg model are refined via a novel merged and dropped strategy as proxy ground truth to train a Mask R-CNN for weakly-supervised instance segmentation. Only using $7991$ salient images, the weakly-supervised Mask R-CNN is on par with fully-supervised Mask R-CNN on PASCAL VOC and significantly outperforms previous state-of-the-art box-supervised instance segmentation methods on COCO. The source code, pretrained models and datasets are available at \url{https://github.com/hustvl/BoxCaseg}.

研究动机与目标

  • 通过仅利用边界框和显著图像标注而非像素级掩码,降低实例分割中的标注成本。
  • 通过在训练过程中将显著图像作为辅助记忆,模仿人类的与类别无关的物体分割方式。
  • 通过一种新颖的代理掩码生成流程(结合合并与丢弃策略),提升弱监督实例分割性能。
  • 在PASCAL VOC和COCO上实现最先进性能,仅使用极少的弱监督信号,接近全监督性能。

提出的方法

  • 一种多任务学习框架,在单一深度神经网络中联合训练边界框监督图像和显著物体检测图像。
  • 通过从多实例分类到像素级分割的权重迁移,增强特征学习。
  • 预训练的BoxCaseg模型为边界框监督图像生成高质量实例掩码,再通过合并与丢弃策略进行优化,形成代理掩码。
  • 将代理掩码用于微调Mask R-CNN,实现弱监督实例分割。
  • 训练策略在每个批次中固定边界框监督图像与显著图像的比例(例如9:7),以平衡数据并提升稳定性。
  • 采用显著分割头与迁移分割头的加权融合,最优性能出现在α=0.7时。
Figure 1: The top row shows a salient training image (a) and two box-supervised training images (b). Our model is jointly trained using both salient images and box-supervised images and obtains high quality instance segmentation results (c).
Figure 1: The top row shows a salient training image (a) and two box-supervised training images (b). Our model is jointly trained using both salient images and box-supervised images and obtains high quality instance segmentation results (c).

实验结果

研究问题

  • RQ1显著物体检测数据能否作为有效辅助记忆,以仅使用边界框标注提升弱监督实例分割性能?
  • RQ2如何有效生成并优化代理掩码,以在弱监督下训练Mask R-CNN?
  • RQ3在联合训练中,边界框监督图像与显著图像的最优平衡比是多少,以最大化性能?
  • RQ4对代理掩码采用合并与丢弃策略是否能显著提升弱监督训练中伪标签的质量?

主要发现

  • 该方法仅使用7,991张显著图像,在COCO验证集上达到70.9 mIoU,优于先前最先进的边界框监督方法。
  • 在PASCAL VOC上,该方法与全监督Mask R-CNN性能相当,达到71.8 mIoU,且在迁移分割头权重α=0.7时表现最佳。
  • 合并策略使COCO上的AP提升0.6,AP75提升0.9;而采用0.95 IoU阈值的丢弃策略表现最佳。
  • 在每个批次中采用9:7的边界框监督图像与显著图像比例时,COCO上达到最佳性能,mIoU为70.9。
  • 当α=0.7时,权重迁移机制相比仅使用单一头提升了1.3%,证明其鲁棒性与有效性。
  • 采用0.95 IoU阈值的丢弃策略在COCO上达到30.9 AP,且80%的掩码被丢弃,表明高质量掩码比大量中等质量掩码更具优势。
Figure 2: The pipeline of our approach. Our training process is divided into three steps. First, we obtain a class-agnostic segmentation model (BoxCaseg) through the joint training of box-supervised dataset and salient object segmentation dataset (Sec. 3.2 ). Then, we use the class-agnostic segmenta
Figure 2: The pipeline of our approach. Our training process is divided into three steps. First, we obtain a class-agnostic segmentation model (BoxCaseg) through the joint training of box-supervised dataset and salient object segmentation dataset (Sec. 3.2 ). Then, we use the class-agnostic segmenta

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。