Skip to main content
QUICK REVIEW

[论文解读] Salvage of Supervision in Weakly Supervised Object Detection

Sui Lin, Chen-Lin Zhang|arXiv (Cornell University)|Jun 8, 2021
Advanced Neural Network Applications被引用 4
一句话总结

本文提出了一种名为监督拯救(Salvage of Supervision, SoS-WSOD)的三阶段框架,通过利用图像级标签、生成高质量伪框标注以及对噪声伪标签数据应用半监督学习,提升了弱监督目标检测的性能。通过整合现代全监督检测技术(如ResNet、RoIAlign和FPN),SoS-WSOD在VOC2007上实现了64.4 mAP50、在VOC2012上实现了61.9 mAP50、在MS-COCO上实现了16.6 mAP50:95的最先进性能,同时通过消除外部提议生成过程,实现了更快的推理速度。

ABSTRACT

Weakly supervised object detection~(WSOD) has recently attracted much attention. However, the lack of bounding-box supervision makes its accuracy much lower than fully supervised object detection (FSOD), and currently modern FSOD techniques cannot be applied to WSOD. To bridge the performance and technical gaps between WSOD and FSOD, this paper proposes a new framework, Salvage of Supervision (SoS), with the key idea being to harness every potentially useful supervisory signal in WSOD: the weak image-level labels, the pseudo-labels, and the power of semi-supervised object detection. This paper proposes new approaches to utilize these weak and noisy signals effectively, and shows that each type of supervisory signal brings in notable improvements, outperforms existing WSOD methods (which mainly use only the weak labels) by large margins. The proposed SoS-WSOD method also has the ability to freely use modern FSOD techniques. SoS-WSOD achieves 64.4 $m ext{AP}_{50}$ on VOC2007, 61.9 $m ext{AP}_{50}$ on VOC2012 and 16.6 $m ext{AP}_{50:95}$ on MS-COCO, and also has fast inference speed. Ablations and visualization further verify the effectiveness of SoS.

研究动机与目标

  • 为弥合弱监督目标检测(WSOD)与全监督目标检测(FSOD)之间的性能与技术差距,当前该差距限制了WSOD仅能使用过时架构并导致推理速度较慢。
  • 解决WSOD中监督信号利用不足的问题,特别是伪框标注和未标注数据的有效利用不足。
  • 通过开发一种能有效利用伪监督和噪声标签学习的框架,使WSOD能够充分受益于现代FSOD技术(如ResNet主干网络、RoIAlign和FPN)。
  • 通过引入一种新颖的三阶段流水线,系统性地恢复并重用监督信号,从而提升WSOD的准确率与推理速度。

提出的方法

  • 第一阶段使用图像级标签训练弱监督检测器,采用改进的基于OICR的方法,并引入一种新的后处理模块(PGF)以过滤和优化检测结果。
  • 第二阶段通过PGF模块生成高质量的伪框标注,从而实现伪全监督检测(pseudo-FSOD)训练阶段,利用如ResNet、RoIAlign和FPN等现代FSOD技术。
  • 第三阶段通过将训练集划分为‘干净’(已标注)和‘噪声’(未标注)子集,提出一种新颖的半监督目标检测(SSOD)设置,采用经验法则平衡类别分布并减轻噪声影响。
  • PGF模块使用两个超参数$t_{keep}$和$t_{con}$,以过滤低置信度检测结果,并基于置信度和提案间的一致性对伪标注进行优化。
  • 该框架将整个伪标注数据集视为噪声数据,应用半监督学习以提升泛化能力并减少因不完美伪标签导致的误差传播。
  • 该方法避免使用外部目标提议生成,通过依赖端到端检测头实现更快的推理速度。

实验结果

研究问题

  • RQ1当仅提供图像级标签时,现代全监督目标检测技术(如ResNet、RoIAlign和FPN)能否在弱监督目标检测中被有效应用?
  • RQ2如何从弱监督检测器中生成高质量的伪框标注,以实现与全监督方法的有效微调?
  • RQ3能否通过将伪标注数据视为噪声,在WSOD中有效利用半监督目标检测?何种划分策略能最大化性能?
  • RQ4在半监督阶段,如何在避免类别不平衡和性能崩溃的前提下,实现标注数据与未标注数据之间的最优平衡?
  • RQ5通过系统性地拯救所有可用的监督信号(包括弱标签、伪标签和未标注数据),WSOD的性能能够提升到何种程度?

主要发现

  • SoS-WSOD在VOC2007上达到64.4 mAP50,显著优于仅依赖图像级标签的先前WSOD方法。
  • 在VOC2012上,SoS-WSOD达到61.9 mAP50,表明其在缺乏框级标注的情况下仍具备强大的跨数据集泛化能力。
  • 在MS-COCO上,SoS-WSOD实现16.6 mAP50:95,相较于以往的WSOD方法有显著提升,并显著缩小了与全监督检测器之间的差距。
  • 该框架的推理速度优于基线WSOD方法,在单张RTX3090 GPU上每张图像的推理时间仅为0.031秒,无需耗时的外部提议生成过程。
  • 消融实验表明,每个阶段(伪FSOD和半监督学习)均对性能提升有显著贡献,其中半监督阶段在使用最优划分大小(VOC2007上K=2000)时尤为有效。
  • 可视化结果表明,SoS-WSOD能检测到更准确且完整的物体,即使在复杂场景中也表现优异,有效缓解了部件主导和聚集预测等问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。