Skip to main content
QUICK REVIEW

[论文解读] Cross-Supervised Object Detection

Zitian Chen, Zhiqiang Shen|arXiv (Cornell University)|Jun 26, 2020
Advanced Neural Network Applications参考文献 36被引用 4
一句话总结

本文提出了一种新型的交叉监督目标检测(CSOD)框架,利用基础类别上完全监督检测的知识,仅通过图像级别标签,提升新类别上的弱监督目标检测性能。通过将检测头与识别头统一,并引入空间相关性模块(SCM)以连接识别与检测任务,该方法在COCO等复杂多目标场景中显著提升了定位精度,大幅超越了先前的弱监督方法。

ABSTRACT

After learning a new object category from image-level annotations (with no object bounding boxes), humans are remarkably good at precisely localizing those objects. However, building good object localizers (i.e., detectors) currently requires expensive instance-level annotations. While some work has been done on learning detectors from weakly labeled samples (with only class labels), these detectors do poorly at localization. In this work, we show how to build better object detectors from weakly labeled images of new categories by leveraging knowledge learned from fully labeled base categories. We call this novel learning paradigm cross-supervised object detection. We propose a unified framework that combines a detection head trained from instance-level annotations and a recognition head learned from image-level annotations, together with a spatial correlation module that bridges the gap between detection and recognition. These contributions enable us to better detect novel objects with image-level annotations in complex multi-object scenes such as the COCO dataset.

研究动机与目标

  • 为解决在仅有图像级别标签而无昂贵实例级别标注的情况下,训练新类别准确目标检测器的挑战。
  • 通过将完全标注的基础类别知识迁移至弱标注的新类别,弥合识别与检测之间的定位差距。
  • 开发一个统一框架,联合优化检测头与识别头,同时减少两者之间的域差距。
  • 提升在COCO等复杂多目标场景中的检测性能,其中现有弱监督方法因干扰物和尺度变化而失效。

提出的方法

  • 统一的网络架构在检测头(基于实例级别标注训练,基础类别)与识别头(基于图像级别标签训练,新类别)之间共享单一主干网络。
  • 识别头为多个目标提议生成类别分数,实现在无真实边界框的情况下进行弱监督定位。
  • 空间相关性模块(SCM)接收识别头中的高置信度提议,并回归为更接近真实边界框的更精确框,从而减少定位偏差。
  • SCM使用双通道热力图(最高置信度与置信度总和)表示提议密度与置信度,实现对边界框的鲁棒回归。
  • 采用两阶段训练策略端到端训练框架:先在5个周期内无检测头监督地预训练识别头,随后联合微调所有组件。
  • 根据数据集复杂度调整提议生成方式——PASCAL VOC使用选择性搜索(少量基础类别),COCO使用RPN(大量基础类别),以提升提议质量。

实验结果

研究问题

  • RQ1基于完全监督检测的基础类别知识,能否提升仅使用图像级别标签的新类别上的弱监督检测性能?
  • RQ2如何弥合识别与检测之间的差距,以提升复杂场景中的定位精度?
  • RQ3在弱监督设置下,共享主干与双头结构的统一框架是否优于独立的识别与检测模型?
  • RQ4空间相关性模块在通过优化识别头生成的提议框方面,能在多大程度上提升定位性能?

主要发现

  • 在COCO数据集上,采用20:60的基础类与新类划分,所提方法在新类别上达到55.7% AP50,显著优于次佳基线(SS:55.7% vs. RPN方法42.5%),并超越先前最先进方法。
  • 消融实验表明,使用FCOS(5层卷积)作为SCM主干网络,在性能与计算成本之间取得最佳平衡。
  • 所提出的结构识别头优于WSDDN与OICR,证明在统一框架中更强的识别头具有显著优势。
  • 空间相关性模块有效纠正定位错误——例如,检测完整人体而非仅头部——并减少共现物体带来的误报。
  • 在PASCAL VOC上,使用选择性搜索生成提议时,模型在新类别上达到72.7% AP50,展现出强大泛化能力,即使基础类别有限。
  • 可视化结果表明,仅识别头仅能定位判别性部分(如头部),而SCM与检测头可生成更完整、更准确的边界框。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。