[论文解读] Towards Open Vocabulary Object Detection without Human-provided Bounding Boxes
本文提出了一种新颖的开放词汇目标检测框架,通过利用预训练的视觉-语言模型生成高质量的伪边界框标签,实现无需人工标注边界框的训练。该方法在性能上达到最先进水平,在COCO新类别上比使用人工标注训练的SOTA模型高出3% AP,当使用相同的人工标注基线时,更是高出8% AP。
Despite great progress in object detection, most existing methods are limited to a small set of object categories, due to the tremendous human effort needed for instance-level bounding-box annotation. To alleviate the problem, recent open vocabulary and zero-shot detection methods attempt to detect object categories not seen during training. However, these approaches still rely on manually provided bounding-box annotations on a set of base classes. We propose an open vocabulary detection framework that can be trained without manually provided bounding-box annotations. Our method achieves this by leveraging the localization ability of pre-trained vision-language models and generating pseudo bounding-box labels that can be used directly for training object detectors. Experimental results on COCO, PASCAL VOC, Objects365 and LVIS demonstrate the effectiveness of our method. Specifically, our method outperforms the state-of-the-arts (SOTA) that are trained using human annotated bounding-boxes by 3% AP on COCO novel categories even though our training source is not equipped with manual bounding-box labels. When utilizing the manual bounding-box labels as our baselines do, our method surpasses the SOTA largely by 8% AP.
研究动机与目标
- 解决现有目标检测方法因标注成本高昂而受限于预定义小类别集的局限性。
- 实现在不依赖人工提供实例级边界框标注的前提下的开放词汇检测。
- 开发一种利用预训练视觉-语言模型进行弱监督伪框生成的训练框架。
- 在缺乏人工边界框标注的情况下,实现在开放词汇检测基准上的最先进性能。
- 证明伪标注训练可达到甚至超越使用人工标注框训练的模型性能。
提出的方法
- 利用预训练的视觉-语言模型为对象查询预测具有定位感知能力的嵌入,实现弱监督定位。
- 通过在多个图像-文本对上聚合视觉-语言模型的注意力图,生成伪边界框标签。
- 使用生成的伪框作为监督信号训练标准目标检测器,无需任何人工标注框。
- 应用对比学习目标,通过将伪框与定位的视觉特征对齐,优化伪框质量。
- 在需要时,对少量基础类别使用人工标注框进行检测器微调,以提升泛化能力。
- 采用多阶段训练流程,逐步优化伪框质量和检测器性能。
实验结果
研究问题
- RQ1能否在不使用任何人工标注边界框的情况下实现开放词汇目标检测?
- RQ2从视觉-语言模型生成的伪边界框在训练目标检测器方面有多高效?
- RQ3在伪标注上训练的检测器能否超越使用人工标注框训练的SOTA模型?
- RQ4所提方法在多个基准上对新类别和基础类别的性能与SOTA相比如何?
- RQ5在开放词汇检测中,利用视觉-语言模型进行弱监督定位有何影响?
主要发现
- 尽管未使用任何人工标注边界框,该方法在COCO新类别上的AP比使用人工标注训练的SOTA模型高出3%。
- 当在与SOTA相同的设置下评估(即使用人工标注框作为基线)时,该方法在AP上超越SOTA 8%,证明了其卓越的学习效率。
- 该方法在多种基准上泛化良好,在COCO、PASCAL VOC、Objects365和LVIS上均表现出色。
- 从视觉-语言模型生成的伪边界框能产生高质量的监督信号,从而实现有效的检测器训练。
- 该方法显著降低了对昂贵人工标注的依赖,同时保持或超越了完全监督基线的性能。
- 结果证实,弱监督伪标注是开放词汇检测中人工标注边界框的可行且强大的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。