Skip to main content
QUICK REVIEW

[论文解读] Cross-dataset Training for Class Increasing Object Detection

Yongqiang Yao, Yan Wang|arXiv (Cornell University)|Jan 14, 2020
Advanced Neural Network Applications参考文献 31被引用 16
一句话总结

本文提出了一种通用的跨数据集训练框架,使单一目标检测器能够联合检测来自多个独立标注数据集(如 COCO、VOC、WIDER Face 和 WIDER Pedestrian)的类别,且准确率损失极小。通过合并语义相同的标签、保留数据集划分,并在冲突的正负样本之间施加避免关系,该方法在所有数据集上同时实现了最先进性能,支持仅需极少重标注的持续学习。

ABSTRACT

We present a conceptually simple, flexible and general framework for cross-dataset training in object detection. Given two or more already labeled datasets that target for different object classes, cross-dataset training aims to detect the union of the different classes, so that we do not have to label all the classes for all the datasets. By cross-dataset training, existing datasets can be utilized to detect the merged object classes with a single model. Further more, in industrial applications, the object classes usually increase on demand. So when adding new classes, it is quite time-consuming if we label the new classes on all the existing datasets. While using cross-dataset training, we only need to label the new classes on the new dataset. We experiment on PASCAL VOC, COCO, WIDER FACE and WIDER Pedestrian with both solo and cross-dataset settings. Results show that our cross-dataset pipeline can achieve similar impressive performance simultaneously on these datasets compared with training independently.

研究动机与目标

  • 解决在工业和研究环境中新增目标类别时,重新标注现有数据集的高昂成本问题。
  • 使单一检测器能够联合识别来自具有不同类别标签的多个数据集中的目标类别。
  • 开发一种通用且灵活的训练流程,避免在合并存在冲突正负样本的数据集时性能下降。
  • 支持持续学习场景,即新类别以增量方式加入,而无需重新标注已有数据。

提出的方法

  • 将不同数据集中语义相同的类别(如 'person' 和 'pedestrian')进行合并,以减少歧义并提升训练稳定性。
  • 通过连接标签构建混合数据集,同时保留原始图像划分和数据集边界。
  • 在来自一个数据集的正样本与来自另一数据集的负样本之间定义避免关系(例如,WIDER Face 中的 face-negative 与 COCO 中的 person-positive),以防止混淆。
  • 使用修改后的分类损失进行检测器训练,使该避免关系在反向传播过程中得以强制执行。
  • 采用 RetinaNet 等标准目标检测框架,搭配 ResNet-50 或 MobileNetV2 作为骨干网络,以评估泛化能力。
  • 在所有数据集中使用一致的锚框尺度和长宽比,以确保公平比较和稳定训练。

实验结果

研究问题

  • RQ1是否可以训练单一目标检测器,在不造成显著性能下降的前提下,联合检测来自多个独立标注数据集的类别联合?
  • RQ2对语义相似类别(如 person/pedestrian)进行标签合并,如何影响跨数据集检测性能?
  • RQ3冲突的正负样本(如 face-negative 与 person-positive)对跨数据集训练有何影响?如何有效缓解?
  • RQ4所提方法是否在不同骨干网络和数据集领域(包括尺度分布不同的数据集)中具有泛化能力?
  • RQ5跨数据集训练是否能够在真实世界应用中支持持续学习,即新类别以增量方式加入?

主要发现

  • 在 COCO 和 VOC 上联合训练时,使用合并标签的跨数据集训练在 VOC 上达到 87.5 mAP,在 COCO 上达到 35.4 mAP,与各数据集单独训练的基线相比,性能匹配或略低。
  • 在联合训练下,WIDER Face 的 AP 保持在 48.32%,WIDER Pedestrian 的 AP 保持在 43.86%,与单数据集基线相比无显著准确率损失。
  • 合并语义相似类别(如 person 和 pedestrian)使性能提升约 0.5 AP,表明分类歧义减少。
  • 该框架在不同骨干网络上均表现良好:ResNet-50 和 MobileNetV2 均取得相似性能,证明其不依赖于模型容量。
  • 在所有数据集中保持锚框尺度一致性,性能得以维持,表明该方法在公平实验设置下有效。
  • 该方法通过将方向视为类别,实现了 360 度人脸检测,展示了其在标准检测之外的新应用场景潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。