[论文解读] Mixed Pseudo Labels for Semi-Supervised Object Detection
本文提出混合伪标签(MixPL),一种检测器无关的框架,通过结合伪混合(Pseudo Mixup)与伪马赛克(Pseudo Mosaic)来缓解误检漏检问题并提升模型对尺度的泛化能力,同时利用有标签数据重采样策略增强长尾类别检测性能。MixPL在COCO基准上取得新的最先进结果,相较于Faster R-CNN、FCOS与DINO Swin-L模型,mAP最高提升2.5%,且无需额外标注。
While the pseudo-label method has demonstrated considerable success in semi-supervised object detection tasks, this paper uncovers notable limitations within this approach. Specifically, the pseudo-label method tends to amplify the inherent strengths of the detector while accentuating its weaknesses, which is manifested in the missed detection of pseudo-labels, particularly for small and tail category objects. To overcome these challenges, this paper proposes Mixed Pseudo Labels (MixPL), consisting of Mixup and Mosaic for pseudo-labeled data, to mitigate the negative impact of missed detections and balance the model's learning across different object scales. Additionally, the model's detection performance on tail categories is improved by resampling labeled data with relevant instances. Notably, MixPL consistently improves the performance of various detectors and obtains new state-of-the-art results with Faster R-CNN, FCOS, and DINO on COCO-Standard and COCO-Full benchmarks. Furthermore, MixPL also exhibits good scalability on large models, improving DINO Swin-L by 2.5% mAP and achieving nontrivial new records (60.2% mAP) on the COCO val2017 benchmark without extra annotations.
研究动机与目标
- 为解决伪标签在半监督目标检测中持续存在的局限性,特别是小目标与长尾类别目标的误检漏检问题。
- 降低检测器偏差在伪标签中被放大的负面影响,尤其是在尺度与类别分布不匹配的情况下。
- 开发一种通用的、检测器无关的方法,无需模型特定修改即可在多种目标检测器上提升性能。
- 通过类别平衡采样重加权有标签数据,提升学习效率与泛化能力,尤其针对低频类别。
- 仅使用无标签数据与最小监督信号,在标准COCO基准上实现最先进性能。
提出的方法
- 提出伪混合(Pseudo Mixup),一种数据增强技术,通过像素级混合两幅伪标签图像,降低对漏检目标的梯度响应,提升泛化能力。
- 引入伪马赛克(Pseudo Mosaic),将四张下采样后的伪标签图像拼接生成新训练样本,增加小目标与中等目标的标注数量。
- 采用动态分辨率策略处理伪马赛克,使用400至800之间的图像尺寸以实现最优mAP并降低训练成本。
- 通过幂参数控制的类别平衡采样策略对有标签数据进行重采样,以过采样稀有类别,提升长尾类别检测性能。
- 采用DetMeanTeacher框架作为统一训练范式,将检测器与半监督学习过程解耦,确保在不同模型间的一致性评估。
- 将MixPL集成至Faster R-CNN、FCOS与DINO等标准检测器中,验证其在多种架构上的广泛兼容性与一致性能增益。
实验结果
研究问题
- RQ1在不同检测器中,伪标签在目标数量、尺度分布与类别频率方面与真实标注系统性差异为何?
- RQ2能否将Mixup与Mosaic等数据增强技术适配至伪标签数据,以减少误检漏检偏差并提升小目标与稀有目标检测性能?
- RQ3在不损害头部类别检测性能的前提下,有标签数据重采样能在多大程度上提升长尾类别性能?
- RQ4所提出的MixPL框架是否能在包括两阶段与一阶段检测器在内的多种检测器架构上实现泛化?
- RQ5MixPL是否能在无需额外标注的情况下,在COCO基准上实现最先进性能?
主要发现
- MixPL在COCO-Val2017上将Faster R-CNN的mAP提升2.5%,达到60.2% mAP,创下半监督目标检测新SOTA纪录。
- 仅使用伪混合(Pseudo Mixup)可使mAP从34.7%提升至35.7%;加入伪马赛克(Pseudo Mosaic)后进一步提升至37.2%,证明了尺度增强伪标签的有效性。
- 伪混合与伪马赛克的组合在mAP与训练成本之间取得最佳平衡,分辨率范围400–800时性能最优。
- 采用幂参数=1.0的有标签数据重采样,使Faster R-CNN对烤面包机的mAP从0.4%提升至41.3%,FCOS则从0.0%提升至57.7%,显著改善长尾类别检测性能。
- 该方法在所有测试检测器(Faster R-CNN、FCOS与DINO Swin-L)上均实现一致性能提升,证明其通用性与检测器无关性。
- 即使仅使用10%有标签数据,MixPL仍优于以往方法,证实其在低监督场景下的可扩展性与高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。