Skip to main content
QUICK REVIEW

[论文解读] Training object class detectors with click supervision

Dim P. Papadopoulos, Jasper Uijlings|arXiv (Cornell University)|Apr 20, 2017
Domain Adaptation and Few-Shot Learning参考文献 64被引用 15
一句话总结

本文提出中心点击标注——即标注者点击对象的中心位置——作为训练目标检测器的快速、低耗时替代方案,以取代耗时的边界框标注。通过将这些点击整合到多实例学习(MIL)框架中,该方法在将总标注时间减少9至18倍的同时,实现了接近全监督模型的检测器性能。

ABSTRACT

Training object class detectors typically requires a large set of images with objects annotated by bounding boxes. However, manually drawing bounding boxes is very time consuming. In this paper we greatly reduce annotation time by proposing center-click annotations: we ask annotators to click on the center of an imaginary bounding box which tightly encloses the object instance. We then incorporate these clicks into existing Multiple Instance Learning techniques for weakly supervised object localization, to jointly localize object bounding boxes over all training images. Extensive experiments on PASCAL VOC 2007 and MS COCO show that: (1) our scheme delivers high-quality detectors, performing substantially better than those produced by weakly supervised techniques, with a modest extra annotation effort; (2) these detectors in fact perform in a range close to those trained from manually drawn bounding boxes; (3) as the center-click task is very fast, our scheme reduces total annotation time by 9x to 18x.

研究动机与目标

  • 通过用更快、更简单的中心点击标注替代耗时的边界框标注,降低训练目标检测器的高成本标注开销。
  • 通过引入更具信息量的弱监督信号(即中心点击)来弥合弱监督与全监督目标检测之间的性能差距。
  • 利用亚马逊机械 Turk 等众包平台实现高效、可扩展的数据收集,且训练成本低、准确率高。
  • 通过利用基于点击的物体中心与大小估计,提升弱监督目标检测中的定位精度。
  • 证明在相同标注预算下,中心点击监督优于现有弱监督方法,包括基于人工验证提议的方法。

提出的方法

  • 通过要求众包工作者点击每个物体实例所对应想象中边界框的中心位置,收集中心点击标注。
  • 在训练阶段使用合成多边形来模拟真实标注者误差和模型误差分布,而无需真实边界框。
  • 通过两个独立点击中心之间的距离来估计物体大小,利用点击误差与物体大小之间的相关性。
  • 将中心点击整合到多实例学习(MIL)框架中,联合定位所有训练图像中的物体边界框。
  • 在MIL的重新定位阶段,利用点击估计的物体中心和大小作为先验,指导选择更准确的边界框。
  • 利用从合成数据中学到的误差模型,在MS COCO上模拟真实点击噪声,从而实现无需真实点击收集的评估。

实验结果

研究问题

  • RQ1中心点击标注是否能显著减少标注时间,同时在目标检测中保持高性能?
  • RQ2与仅使用图像级别标签的弱监督方法相比,中心点击监督在定位和检测精度方面表现如何?
  • RQ3两个独立点击中心之间的距离是否能可靠地估计物体大小?这种估计是否能在无真实边界框的情况下提升定位性能?
  • RQ4在相同标注预算下,中心点击监督是否优于近期基于人工验证的弱监督方法?
  • RQ5基于合成多边形的误差建模在多大程度上能泛化到真实世界点击数据,以支持训练与评估?

主要发现

  • 与手动边界框标注相比,中心点击标注将总标注时间减少了9至18倍,单个物体的中位标注时间仅为1.9秒。
  • 在PASCAL VOC 2007上,该方法实现了67.2%的CorLoc,比弱监督MIL高出11.7%,接近全监督检测器的性能。
  • 在MS COCO上,模拟的双点击方法实现了58.6%的CorLoc和19.3%的mAP,在相同250小时标注预算下,优于人工验证方法[46],分别高出+16%的CorLoc和+4%的mAP。
  • 该方法优于基线弱监督方案:随机点击仅获得43.4%的CorLoc,'点击任意位置'获得55.5%的CorLoc,而中心点击在VOC 2007上达到67.2%的CorLoc。
  • 在相同人力投入下,中心点击监督相比标准弱监督学习,使检测性能在CorLoc上提升了超过10%。
  • 中心点击监督的性能具有鲁棒性和泛化能力,模拟点击在COCO上实现51.8%的CorLoc(单点击)和58.6%的CorLoc(双点击),显著优于基线MIL(24.2%的CorLoc)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。