[论文解读] Open Vocabulary Object Detection with Pseudo Bounding-Box Labels
本文提出一种方法,利用预训练的视觉-语言模型和大规模图像-字幕对,为开放词汇目标检测生成伪边界框标注。通过利用这些模型的定位能力,自动生成多样化、可扩展的训练标注,该方法在无需基础类别人工标注框的情况下,显著提升了对新类别物体的检测性能,在 COCO 新类别上的 mAP 提升了 8%。
Despite great progress in object detection, most existing methods work only on a limited set of object categories, due to the tremendous human effort needed for bounding-box annotations of training data. To alleviate the problem, recent open vocabulary and zero-shot detection methods attempt to detect novel object categories beyond those seen during training. They achieve this goal by training on a pre-defined base categories to induce generalization to novel objects. However, their potential is still constrained by the small set of base categories available for training. To enlarge the set of base classes, we propose a method to automatically generate pseudo bounding-box annotations of diverse objects from large-scale image-caption pairs. Our method leverages the localization ability of pre-trained vision-language models to generate pseudo bounding-box labels and then directly uses them for training object detectors. Experimental results show that our method outperforms the state-of-the-art open vocabulary detector by 8% AP on COCO novel categories, by 6.3% AP on PASCAL VOC, by 2.3% AP on Objects365 and by 2.8% AP on LVIS. Code is available at https://github.com/salesforce/PB-OVD.
研究动机与目标
- 解决现有开放词汇检测方法依赖少量人工标注基础类别所带来的局限性。
- 通过从大规模图像-字幕数据集中自动生成伪标签,减少对昂贵人工标注边界框的依赖。
- 通过扩大训练过程中使用的基础类别多样性与规模,提升对新类别物体的泛化能力。
- 评估伪边界框标注在多个基准数据集上对检测性能的增强效果。
- 研究不同文本编码器和数据规模对伪标签质量与泛化能力的影响。
提出的方法
- 利用预训练的视觉-语言模型,通过 Grad-CAM 生成与图像字幕中提及物体相对应的激活图。
- 将激活图转换为图像-字幕对中对应物体类别的伪边界框标注。
- 使用自动生成的伪标签训练开放词汇目标检测器,使其能够泛化到新类别。
- 在有可用人类标注框时对检测器进行微调,但即使不进行微调,该方法依然有效。
- 将伪标签生成过程扩展至大规模图像-字幕数据集(如 COCO Captions),以增加基础类别的多样性与数量。
- 评估不同文本编码器(如 CLIP 与 BERT)以及数据量对最终检测器性能的影响。
实验结果
研究问题
- RQ1从图像-字幕对中生成的伪边界框标注能否提升开放词汇目标检测的性能?
- RQ2伪标注基础类别的规模与多样性如何影响对新类别的检测泛化能力?
- RQ3利用预训练视觉-语言模型的定位能力,是否能生成比人工标注基线更准确且更具泛化能力的伪标签?
- RQ4选择不同的文本编码器(如 CLIP 与 BERT)如何影响生成伪标签的质量与下游检测性能?
- RQ5即使不基于人类标注的基础类别进行微调,该方法是否仍能超越当前最先进水平的开放词汇检测器?
主要发现
- 当两者均在 COCO 基础类别上进行微调时,该方法在 COCO 新类别上的 mAP 比最先进方法高出 8%。
- 即使不进行 COCO 基础类别的微调,该方法在 COCO 新类别上的 mAP 仍比微调后的 SOTA 基线高出 3%。
- 在预训练阶段使用超出 COCO 的更大类别词汇表,可在 Objects365 上提升 2.3%、在 LVIS 上提升 2.7%。
- 增加用于生成伪标签的图像-字幕数据量,可使目标数据集上的检测性能提升约 2%。
- 使用 CLIP 作为文本编码器的方法略优于使用 BERT 的方法,表明性能提升主要源于伪标签的规模与多样性,而非编码器选择本身。
- 定性结果表明,伪标签生成器能够成功定位 COCO 原始类别列表之外的物体(如拖鞋、锅、派),证明其具备对词汇外物体的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。