Skip to main content
QUICK REVIEW

[论文解读] Instance Segmentation with Point Supervision

Issam Laradji, Negar Rostamzadeh|arXiv (Cornell University)|Jun 14, 2019
Advanced Neural Network Applications参考文献 54被引用 13
一句话总结

本文提出 WISE,一种弱监督实例分割方法,仅使用点级标注进行训练——每对象仅需一个标注点。该方法采用双分支网络结构:定位网络(L-Net)用于预测物体中心,嵌入网络(E-Net)用于将特征相似的像素聚类,进而在嵌入空间中生成分割掩码。该方法在 PASCAL VOC、COCO、KITTI 和 CityScapes 上的性能与全监督模型相当,并为点级监督实例分割设立了新的强基线。

ABSTRACT

Instance segmentation methods often require costly per-pixel labels. We propose a method that only requires point-level annotations. During training, the model only has access to a single pixel label per object, yet the task is to output full segmentation masks. To address this challenge, we construct a network with two branches: (1) a localization network (L-Net) that predicts the location of each object; and (2) an embedding network (E-Net) that learns an embedding space where pixels of the same object are close. The segmentation masks for the located objects are obtained by grouping pixels with similar embeddings. At training time, while L-Net only requires point-level annotations, E-Net uses pseudo-labels generated by a class-agnostic object proposal method. We evaluate our approach on PASCAL VOC, COCO, KITTI and CityScapes datasets. The experiments show that our method (1) obtains competitive results compared to fully-supervised methods in certain scenarios; (2) outperforms fully- and weakly- supervised methods with a fixed annotation budget; and (3) is a first strong baseline for instance segmentation with point-level supervision.

研究动机与目标

  • 为解决全监督实例分割中密集像素级标注带来的高昂标注成本问题。
  • 探索点级监督作为更高效替代方案的潜力,因为点标注的收集速度比像素级标签快一个数量级。
  • 开发一种仅使用每对象一个点即可实现具有竞争力实例分割性能的方法,且训练过程中无需完整掩码。
  • 在点级监督设定下建立实例分割的强基线,该设定在很大程度上仍属弱监督研究的空白领域。

提出的方法

  • 该方法采用双分支架构:L-Net 利用点级监督预测物体中心位置。
  • E-Net 学习一个像素嵌入空间,使得同一物体的像素在该空间中聚类得更紧密,从而通过相似性实现掩码分组。
  • 训练期间,由于缺乏真实掩码,E-Net 通过类无关的目标提议方法生成的伪掩码进行监督。
  • 推理时,L-Net 预测物体中心,E-Net 为所有像素分配嵌入,随后通过聚类生成最终掩码。
  • 最终掩码通过目标提议方法进行优化,以提升定位精度和边界质量。
  • 模型采用端到端训练,结合 L-Net 的定位损失与 E-Net 的对比嵌入损失。

实验结果

研究问题

  • RQ1是否可以仅使用每对象一个点、无需任何像素级标注,有效训练实例分割模型?
  • RQ2在相同标注预算下,点级监督训练的模型性能与全监督方法相比如何?
  • RQ3基于嵌入的方法结合目标提议生成的伪掩码,能否实现具有竞争力的实例分割结果?
  • RQ4在标注成本受限的情况下,所提方法是否优于现有弱监督基线?

主要发现

  • WISE 在 PASCAL VOC 和 COCO 上实现了具有竞争力的实例分割性能,在固定标注预算下优于全监督与弱监督方法。
  • 在 KITTI 上,WISE 实现了 74.2 的 MWCov 和 58.9 的 MUCov,显著优于基线方法 'L-Net + Best Proposal',并建立了强大的弱监督基线。
  • 在 CityScapes 上,WISE 实现了 7.8 的 AP,尽管低于全监督方法,但为该场景下的点级监督实例分割设立了新的强基线。
  • 当使用真实点作为 E-Net 的输入时,该方法在 car 上达到 77.6 mAP,person 上为 55.4,traffic light 上为 77.8,traffic sign 上为 80.1,部分类别上优于测试时使用边界框的方法。
  • 消融实验表明,与仅依赖最佳提议相比,E-Net 显著提升了掩码质量,验证了学习嵌入的价值。
  • 定性结果表明,WISE 在所有数据集上均能成功生成多样物体类别(包括汽车、行人和交通标志)的准确掩码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。