[论文解读] Complementary datasets to COCO for object detection
本文引入了两个互补的数据集——COCO_OI 和 ObjectNet_D,以应对 COCO 目标检测基准性能的饱和问题。COCO_OI 将 COCO 与 OpenImages(80 个共有的类别)相结合,使训练数据增加 80%,而 ObjectNet_D 则提供了用于测试泛化能力的真实世界、多视角图像。模型在这两个数据集上的表现出现显著下降,凸显了其在 COCO 之外的鲁棒性和泛化能力的局限性。
For nearly a decade, the COCO dataset has been the central test bed of research in object detection. According to the recent benchmarks, however, it seems that performance on this dataset has started to saturate. One possible reason can be that perhaps it is not large enough for training deep models. To address this limitation, here we introduce two complementary datasets to COCO: i) COCO_OI, composed of images from COCO and OpenImages (from their 80 classes in common) with 1,418,978 training bounding boxes over 380,111 images, and 41,893 validation bounding boxes over 18,299 images, and ii) ObjectNet_D containing objects in daily life situations (originally created for object recognition known as ObjectNet; 29 categories in common with COCO). The latter can be used to test the generalization ability of object detectors. We evaluate some models on these datasets and pinpoint the source of errors. We encourage the community to utilize these datasets for training and testing object detection models. Code and data is available at https://github.com/aliborji/COCO_OI.
研究动机与目标
- 通过引入更大、更多样化的训练和评估数据集,解决 COCO 上性能饱和的问题。
- 通过包含具有不同视角和背景的现实世界、日常物体场景,提升模型的泛化能力。
- 创建一个验证集,用于诊断目标检测器在标准 COCO 基准之外的失败模式。
- 鼓励社区使用这些数据集来训练和测试目标检测模型,以提升鲁棒性。
提出的方法
- COCO_OI 通过使用 80 个共有的类别将 COCO 与 OpenImages 合并构建而成,排除高频类别(如人、汽车、椅子)以避免数据不平衡。
- 将 OpenImages 中的图像按原始宽高比缩放,最大尺寸为 640 像素,以确保与 COCO 的图像尺寸分布兼容。
- ObjectNet_D 通过人工标注来自 ObjectNet 数据集的 5,875 张图像构建而成,选取了与 COCO 共有的 29 个类别,每张图像仅包含一个物体。
- 为两个数据集建立了新的验证集,以利用 TIDE(一种检测性能诊断工具)实现系统的错误分析。
- 定义了类别映射,将 OpenImages 和 ObjectNet 的类别与 COCO 的 80 个类别对齐,以支持跨数据集评估。
- 数据集已完整发布,并附带完整的许可信息,包括对 ObjectNet_D 的模型微调限制。
实验结果
研究问题
- RQ1将 COCO 与 OpenImages 结合是否能生成更大、更多样化的训练数据集,从而提升目标检测性能?
- RQ2当前最先进目标检测器在具有不同视角和背景的真实世界、日常物体场景中,其泛化能力如何?
- RQ3与 COCO 相比,当前检测器在 COCO_OI 和 ObjectNet_D 上的关键失败模式是什么?
- RQ4来自 ObjectNet_D 的专用验证集是否能有效诊断模型的鲁棒性和泛化能力局限?
主要发现
- EfficientDet 在 COCO 上达到 51.2 AP,但在 COCO_OI 上仅达到 44.0 AP,表明在扩展数据集上性能显著下降。
- 在 ObjectNet_D 上,EfficientDet 的 AP 下降至 23.9,AP_S 为 0.0,暴露出因物体尺度大和背景复杂而导致的小物体检测严重失败。
- DetectoRS 展现出类似趋势,在 COCO_OI 上达到 51.5 AP,在 ObjectNet_D 上为 20.3 AP,证实鲁棒性问题具有模型无关性。
- 使用 TIDE 进行的错误分析显示,模型在小物体和复杂场景中表现更差,尤其在 ObjectNet_D 中,物体大且视角异常。
- ObjectNet_D 上的性能下降——特别是 AP_S 接近零——表明当前检测器在杂乱的真实世界场景中难以处理小物体。
- 本研究证实,数据多样性与真实世界的变化对提升泛化能力至关重要,而当前的基准(如 COCO)可能无法完全捕捉检测挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。