[论文解读] Exploiting Web Images for Weakly Supervised Object Detection
本文提出了一种课程学习框架,利用具有高语义和分布相关性的多样化网络图像,以提升弱监督目标检测(WSD)的性能。通过构建大规模、带属性增强的网络图像数据集,并采用基于相关性的过滤机制进行从易到难的训练,该方法实现了最先进性能,在PASCAL VOC2007上mAP提升2.9%,在VOC2012上提升3.8%,相较基线方法WSDDN有显著改进。
In recent years, the performance of object detection has advanced significantly with the evolving deep convolutional neural networks. However, the state-of-the-art object detection methods still rely on accurate bounding box annotations that require extensive human labelling. Object detection without bounding box annotations, i.e, weakly supervised detection methods, are still lagging far behind. As weakly supervised detection only uses image level labels and does not require the ground truth of bounding box location and label of each object in an image, it is generally very difficult to distill knowledge of the actual appearances of objects. Inspired by curriculum learning, this paper proposes an easy-to-hard knowledge transfer scheme that incorporates easy web images to provide prior knowledge of object appearance as a good starting point. While exploiting large-scale free web imagery, we introduce a sophisticated labour free method to construct a web dataset with good diversity in object appearance. After that, semantic relevance and distribution relevance are introduced and utilized in the proposed curriculum training scheme. Our end-to-end learning with the constructed web data achieves remarkable improvement across most object classes especially for the classes that are often considered hard in other works.
研究动机与目标
- 为解决仅依赖图像级别标签而无边界框标注的弱监督目标检测方法中缺乏有效方法的问题。
- 构建一个大规模、多样化且相关的网络图像数据集,为难以检测的物体提供强外观先验。
- 设计一种课程学习方案,以结构化、分层的方式将知识从简单、清晰的网络图像迁移到复杂、杂乱的目标图像中。
- 通过整合具有语义和分布相关性的网络数据,提升检测性能,特别是对小物体或遮挡物体的检测性能。
提出的方法
- 采用多属性网络数据生成方案,通过结合文本查询与通用属性表,以实现可扩展、无需人工干预的数据收集,增强类别内多样性。
- 利用预训练分类器计算语义相关性,以筛选与目标物体类别相关的网络图像。
- 通过特征空间中的k近邻(kNN)方法度量分布相关性,确保网络图像与目标数据集图像位于同一流形上。
- 提出一种从易到难的课程学习框架,先对网络图像(更简单)进行训练,再对目标图像(更难)进行训练,并采用分层的课程结构。
- 在训练过程中整合相关性过滤(语义与分布相关性),以防止噪声或无关数据降低性能。
- 该方法与现有WSD基线兼容,可作为即插即用的增强模块应用于WSDDN,无需边界框标注即可提升泛化能力。
实验结果
研究问题
- RQ1背景干净、构图简单的网络图像能否作为弱监督目标检测的有效外观先验?
- RQ2如何在无需人工标注的情况下构建大规模、多样化且相关的网络图像数据集?
- RQ3语义相关性与分布相关性对提升WSD性能的相对贡献如何?
- RQ4从易到难的课程学习方案能否有效实现将网络图像知识迁移到复杂目标图像中的弱监督检测任务?
主要发现
- 所提出的结合多属性扩展与相关性过滤的网络数据集显著提升了检测性能,在PASCAL VOC2007上相较WSDDN实现2.9%的mAP增益。
- WebRelETH变体(结合语义相关性与从易到难训练)在VOC2007上达到最优mAP 36.8%,相较基线WSDDN提升2.9个百分点。
- 在VOC2012上,该方法实现3.8%的mAP提升,表明其在不同数据集间具有强大的泛化能力。
- 简单地将网络图像与目标图像混合(WebRel)反而导致性能劣于基线,表明非结构化的数据融合会损害学习效果。
- 基于kNN的分布相关性带来的性能略低于语义相关性,表明语义对齐比细粒度特征分布匹配更为关键。
- 可视化对比显示,所提方法能优化边界框预测,并检测到此前被遗漏的物体,尤其在杂乱场景中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。