[论文解读] Cap2Det: Learning to Amplify Weak Caption Supervision for Object Detection
Cap2Det 提出了一种新颖的弱监督目标检测框架,通过训练仅文本分类器来泛化超出数据集边界并增强弱信号,从而利用自由格式的图像字幕作为监督信号。该方法在 PASCAL VOC 和 COCO 基准上实现了最先进(SOTA)的弱监督目标检测性能,mAP 提升最高达 11%,且无需额外微调或模型集成。
Learning to localize and name object instances is a fundamental problem in vision, but state-of-the-art approaches rely on expensive bounding box supervision. While weakly supervised detection (WSOD) methods relax the need for boxes to that of image-level annotations, even cheaper supervision is naturally available in the form of unstructured textual descriptions that users may freely provide when uploading image content. However, straightforward approaches to using such data for WSOD wastefully discard captions that do not exactly match object names. Instead, we show how to squeeze the most information out of these captions by training a text-only classifier that generalizes beyond dataset boundaries. Our discovery provides an opportunity for learning detection models from noisy but more abundant and freely-available caption data. We also validate our model on three classic object detection benchmarks and achieve state-of-the-art WSOD performance. Our code is available at https://github.com/yekeren/Cap2Det.
研究动机与目标
- 通过利用免费获取的非结构化图像字幕作为弱监督,解决目标检测中边界框标注的高昂成本问题。
- 克服现有弱监督检测(WSOD)方法对精确图像级标签的依赖,而这类标签在实际场景中往往不可用。
- 开发一种方法,从不精确、非穷尽且嘈杂的字幕中提取有意义的对象级监督信号。
- 通过学习一个可泛化的文本分类器,将人类撰写的字幕与图像中的实际对象关联,弥合两者之间的差距。
- 仅使用从字幕中提取的图像级标签,实现最先进(SOTA)的 WSOD 性能,无需依赖昂贵的边界框标注。
提出的方法
- 在少量对象类别标签上训练仅文本分类器,将自由格式字幕映射到离散的对象类别,实现对训练数据集边界的泛化。
- 使用文本分类器预测的伪标签作为弱监督,训练基于多实例学习(MIL)的目标检测器。
- 采用迭代优化过程(OICR)对目标候选区域的类别得分和检测得分进行联合优化,提升定位精度。
- 使用现成的区域提议网络,并通过可微分的端到端训练方案,联合优化类别得分和检测得分。
- 利用文本分类器设计过滤机制,排除可能不提及目标对象的字幕,降低噪声并提升数据质量(例如,从 Flickr30K 构建 Flickr200K)。
- 采用两阶段训练流程:首先在 COCO 上训练文本分类器,然后将其迁移至 VOC 和 COCO 的下游检测任务。
实验结果
研究问题
- RQ1自由格式的自然语言字幕能否在无需边界框标注的情况下,有效用于训练弱监督目标检测器?
- RQ2如何增强来自嘈杂、不精确且非穷尽性字幕的信号,使其适用于目标检测任务?
- RQ3在少量对象类别上预训练的文本分类器,是否具备足够的泛化能力,可将多样化字幕映射到不同数据集中的相关对象类别?
- RQ4通过可泛化的文本分类器增强弱字幕信号,是否能带来相比标准 WSOD 方法的检测性能提升?
- RQ5随着字幕数据量的增加,检测性能能提升到何种程度?该系统的潜在上限是什么?
主要发现
- 在 100 万张带字幕图像上进行训练时,Cap2Det 在 PASCAL VOC 2007 上达到 54.4% 的 mAP,该结果通过拟合的平方根函数估算得出。
- 在 PASCAL VOC 2007 上,Cap2Det 相比最强单模型基线方法(PCL-OB-G VGG16)mAP 提升 11%,并超越 TS2C 方法 9%。
- 在 PASCAL VOC 2012 上,Cap2Det 在 IoU=0.5 时达到 23.4% 的 mAP,且在 COCO 的 mAP@0.5:0.95 上相比此前最先进 WSOD 方法(PCL-OB-G Ens.+FRCNN)提升 15%。
- 与未优化的 OICR VGG_M 主干网络相比,Cap2Det 实现了 27% 的 mAP 提升,证明了所提出检测主干网络的有效性。
- 通过 OICR 的迭代优化,在 VOC 2007 上实现 30% 的 mAP 提升,相比基线 OICR 方法在相同设置下提升 8%。
- 即使不使用后处理或模型集成,Cap2Det 仍能实现具有竞争力的性能,表明其从字幕监督中具备强大的内在泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。