Skip to main content
QUICK REVIEW

[论文解读] Learning to Segment Every Thing

Ronghang Hu, Piotr Dollár|arXiv (Cornell University)|Nov 28, 2017
Advanced Image and Video Retrieval Techniques参考文献 30被引用 15
一句话总结

本文提出了一种部分监督实例分割框架,该框架在包含80个COCO类别(带掩码标注)和3000个Visual Genome类别(仅带边界框标注)的混合数据集上训练Mask R-CNN,利用一个学习到的权重迁移函数,从检测特征预测分割掩码。该方法在未见类别上的掩码AP实现了40%的相对提升,实现了在数千个概念上的大规模实例分割,且仅需极少的掩码监督。

ABSTRACT

Most methods for object instance segmentation require all training examples to be labeled with segmentation masks. This requirement makes it expensive to annotate new categories and has restricted instance segmentation models to ~100 well-annotated classes. The goal of this paper is to propose a new partially supervised training paradigm, together with a novel weight transfer function, that enables training instance segmentation models on a large set of categories all of which have box annotations, but only a small fraction of which have mask annotations. These contributions allow us to train Mask R-CNN to detect and segment 3000 visual concepts using box annotations from the Visual Genome dataset and mask annotations from the 80 classes in the COCO dataset. We evaluate our approach in a controlled study on the COCO dataset. This work is a first step towards instance segmentation models that have broad comprehension of the visual world.

研究动机与目标

  • 使实例分割模型能够泛化到数千个物体类别,而无需为所有类别提供完整的掩码标注。
  • 通过利用丰富且成本较低的边界框标注,解决实例掩码标注的高成本和稀缺性问题。
  • 开发一种迁移学习方法,仅使用检测特征作为输入,即可实现对未见类别的掩码预测。
  • 将实例分割能力扩展至远超现有模型典型100类限制的广泛视觉世界理解范围。
  • 证明利用Visual Genome和COCO等数据集的部分监督实现大规模实例分割的可行性。

提出的方法

  • 提出了一种新颖的部分监督实例分割任务,其中仅一小部分类别(80个COCO类别)具有掩码标注,其余类别(3000个VG类别)仅具有边界框标注。
  • 引入了一个参数化的权重迁移函数 $\mathcal{T}$,用于从每个类别的检测头参数预测分割掩码头参数。
  • 仅使用具有掩码标注的80个类别端到端训练权重迁移函数,从而在推理阶段实现向未见类别的迁移。
  • 在掩码头中引入一个与类别无关的多层感知机(MLP),以提升在多样化类别上的泛化能力。
  • 采用两阶段训练策略:首先在Visual Genome的边界框上对3000个类别训练Faster R-CNN检测器,然后在COCO掩码上使用权重迁移函数微调掩码头。
  • 使用ResNet-101-FPN作为主干网络,并在COCO(用于定量评估)和Visual Genome(用于定性扩展)上应用该方法。

实验结果

研究问题

  • RQ1深度学习模型能否仅使用大多数类别边界框标注和少量类别掩码标注,泛化到数千个物体类别进行实例分割?
  • RQ2学习到的权重迁移函数在未见类别上从检测特征向分割掩码预测迁移知识方面有多有效?
  • RQ3在仅用少量掩码标注类别(如COCO)进行训练的模型,能在多大程度上泛化到语义上差异极大的、仅具边界框标注的大量类别(如Visual Genome)?
  • RQ4在真实世界数据集上使用部分监督进行训练的大规模实例分割模型,其定性能力如何?
  • RQ5与强基线相比,该方法能否在无任何训练掩码的类别上显著提升掩码AP?

主要发现

  • 在COCO数据集上,与强基线相比,该方法在无掩码标注类别的掩码AP上实现了40%的相对提升。
  • 该方法在掩码AP上优于其他替代方法(如使用GrabCut掩码训练的Mask R-CNN),相对提升超过20%。
  • 权重迁移函数实现了有效的泛化:即使没有掩码监督,模型也能为2920个与COCO无重叠的Visual Genome类别生成合理的分割掩码。
  • 在Visual Genome上的定性结果表明,该模型能够分割抽象概念(如阴影和路径),并能区分整体物体及其组成部分(如窗户、把手)。
  • 该模型对“stuff”类概念(如森林)的分割可靠性低于“thing”类概念(如孤立的树),表明其在处理语义模糊性方面存在局限。
  • 该方法在不同主干网络架构上均表现出泛化能力,ResNet-50-FPN和ResNet-101-FPN主干均显示出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。