[论文解读] A Strong and Reproducible Object Detector with Only Public Datasets
该论文提出 Focal-Stable-DINO,一种强大且完全可复现的物体检测器,在仅使用公开数据集且不使用测试时增强的情况下,于 COCO val2017 上达到 64.6 AP,在 COCO test-dev 上达到 64.8 AP。该模型结合了 FocalNet-Huge 主干网络与 Stable-DINO 检测头,仅使用 ImageNet-22K 和 Objects365 进行预训练,避免使用私有数据和复杂训练技术。
This work presents Focal-Stable-DINO, a strong and reproducible object detection model which achieves 64.6 AP on COCO val2017 and 64.8 AP on COCO test-dev using only 700M parameters without any test time augmentation. It explores the combination of the powerful FocalNet-Huge backbone with the effective Stable-DINO detector. Different from existing SOTA models that utilize an extensive number of parameters and complex training techniques on large-scale private data or merged data, our model is exclusively trained on the publicly available dataset Objects365, which ensures the reproducibility of our approach.
研究动机与目标
- 开发一种强大且完全可复现的物体检测模型,不依赖私有数据集或复杂训练技术。
- 通过仅使用公开可用的数据集(如 Objects365 和 COCO)来应对物体检测领域的可复现性危机。
- 通过一种稳健且公开可获取的流程,提升在小物体和密集物体等挑战性物体类别上的检测性能。
- 指出 COCO 数据集中存在的标注质量问题,例如标签缺失和标准不一致,这些因素影响模型泛化能力和训练稳定性。
提出的方法
- 使用 FocalNet-Huge(689M 参数)作为主干网络,仅在 ImageNet-22K 上预训练,以获得强大的特征表示能力。
- 采用 Stable-DINO 检测头,其引入了位置监督损失和位置调制的代价函数,以稳定解码器各层的训练过程。
- 在公开的 Objects365 数据集上进行检测器的预训练,在 COCO 上进行微调,完全避免使用任何私有数据。
- 避免使用如掩码图像建模或图文对比学习等复杂训练技术,以确保方法的简洁性和可复现性。
- 采用标准的端到端训练流程,使用标准的数据增强和标准优化策略,不使用测试时增强。
- 依赖 GitHub 仓库中公开提供的 FocalNet 和 Stable-DINO 的代码与权重,实现完全可复现性。
实验结果
研究问题
- RQ1能否仅使用公开可用的数据集构建一个强大的物体检测器,而无需依赖私有数据或复杂的预训练技术?
- RQ2将强大的主干网络(FocalNet-Huge)与稳定的检测头(Stable-DINO)结合,对 COCO 上的性能有何影响?
- RQ3COCO 中标注不一致和标签缺失问题在多大程度上影响了模型的训练和泛化能力?
- RQ4模型是否能在不使用测试时增强或大规模数据整理的情况下,在 COCO test-dev 上实现 SOTA 性能?
- RQ5当仅使用公开数据时,各类物体(尤其是小物体和密集物体)之间的性能差异有多大?
主要发现
- Focal-Stable-DINO 在 COCO val2017 上达到 64.6 AP,在 COCO test-dev 上达到 64.8 AP,创下仅使用公开数据集训练的模型的新 SOTA 记录。
- 该模型优于现有依赖私有数据、掩码图像建模或复杂数据整理流程的 SOTA 方法。
- 可视化结果表明,该模型在检测小物体和密集物体方面表现出色,红箭头标示了困难样本的检测结果。
- 本研究识别出 COCO 数据集中存在显著的标注问题,例如苹果等物体的标签缺失,以及香蕉等物品的标注标准不一致。
- 各类物体之间的性能差距依然显著,尤其在小物体上,表明检测泛化能力仍面临挑战。
- 该模型在不使用测试时增强的情况下仍能取得优异性能,证实其具备强大的归纳偏置和泛化能力,即使在标准训练协议下亦表现稳健。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。