[论文解读] Scalable Deep Learning Logo Detection
本文提出可扩展标志自协同学习(SL²),一种增量深度学习方法,通过跨模型协同学习从噪声网络数据中自动自发现正样本训练图像,实现可扩展的标志检测。该方法构建了包含194个标志类别、共219万张图像的WebLogo-2M数据集,并证明SL²在无需详尽人工边界框标注的情况下,实现了大规模标志检测的最先进性能。
Existing logo detection methods usually consider a small number of logo classes and limited images per class with a strong assumption of requiring tedious object bounding box annotations, therefore not scalable to real-world dynamic applications. In this work, we tackle these challenges by exploring the webly data learning principle without the need for exhaustive manual labelling. Specifically, we propose a novel incremental learning approach, called Scalable Logo Self-co-Learning (SL^2), capable of automatically self-discovering informative training images from noisy web data for progressively improving model capability in a cross-model co-learning manner. Moreover, we introduce a very large (2,190,757 images of 194 logo classes) logo dataset "WebLogo-2M" by an automatic web data collection and processing method. Extensive comparative evaluations demonstrate the superiority of the proposed SL^2 method over the state-of-the-art strongly and weakly supervised detection models and contemporary webly data learning approaches.
研究动机与目标
- 为解决标志检测中的可扩展性挑战,现有方法受限于高昂的标注成本以及具有细粒度边界框标签的小规模数据集。
- 实现增量模型学习,使检测能力能逐步扩展至新标志类别,而无需从头开始重新训练或进行人工标注。
- 构建一个大规模、自动整理的标志数据集,支持动态扩展和真实世界部署。
- 探索网络数据学习作为监督学习的可行替代方案,减少对昂贵人工标注的依赖。
提出的方法
- 提出可扩展标志自协同学习(SL²),一种交替进行正样本自发现与两个深度检测模型(Faster R-CNN和YOLOv2)之间协同学习的增量学习框架。
- 采用跨模型协同学习策略,其中一个模型的预测结果引导另一个模型自发现新的训练样本,从而利用模型间的互补检测优势。
- 通过上下文增强(CE)实施合成上下文增强,以平衡训练数据并减少负类不平衡,提升模型泛化能力。
- 利用来自Twitter的网络数据自动收集和处理图像,构建包含2,190,757张图像、覆盖194个标志类别的WebLogo-2M数据集。
- 实施一种自发现机制,通过迭代挖掘高检测置信度图像作为新训练数据,即使在噪声较大、弱监督的来源中亦可实现。
- 引入多类别检测设置,结合类别平衡采样与数据增强,以提升模型鲁棒性与可扩展性。
实验结果
研究问题
- RQ1自学习与协同学习框架是否能在无需详尽目标级边界框标注的情况下,有效提升标志检测性能?
- RQ2Faster R-CNN与YOLOv2之间的跨模型协同学习在可扩展标志检测中如何提升检测准确率与泛化能力?
- RQ3合成上下文增强在增量学习过程中在多大程度上改善模型性能并防止负类不平衡?
- RQ4所提出的SL²方法在大规模真实世界标志检测任务中,与最先进强监督与弱监督检测模型相比表现如何?
- RQ5如WebLogo-2M这类自动构建的网络弱监督数据集,是否能支持标志检测模型的可扩展、动态扩展?
主要发现
- SL²在WebLogo-2M数据集上达到46.9%的平均精度均值(mAP),显著优于自学习基线模型(Faster R-CNN为36.8%,YOLO为39.4%)以及最先进模型。
- 与自学习相比,跨模型协同学习使Faster R-CNN的mAP提升7.4%,YOLOv2提升7.5%,证明了互补模型预测的显著优势。
- 在无CE的5次迭代中,mAP从28.0%提升至44.4%,表明上下文增强在抑制负类不平衡和提升泛化能力方面具有关键作用。
- 在8轮增量学习中,模型性能保持稳定提升,自发现图像在外观与上下文上变得日益多样化与复杂。
- WebLogo-2M数据集支持可扩展的模型训练并推动未来研究,其包含194个标志类别与219万张自动从Twitter收集的图像。
- 误检率随迭代次数增加而上升,证实自发现数据噪声逐渐增加,但得益于协同学习与上下文增强,模型仍保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。