[论文解读] Data-Uncertainty Guided Multi-Phase Learning for Semi-Supervised Object Detection
本文提出了一种基于数据不确定性的多阶段学习框架,用于半监督目标检测,通过在不同训练阶段分离易样本与难样本的未标注图像,提升了模型的鲁棒性。通过利用图像级不确定性进行数据选择,以及利用区域级不确定性进行区域提议框(RoI)重加权,该方法减少了噪声过拟合,实现了SOTA性能,在PASCAL VOC上超越先前方法超过3%,在MS COCO上超越2%。
In this paper, we delve into semi-supervised object detection where unlabeled images are leveraged to break through the upper bound of fully-supervised object detection models. Previous semi-supervised methods based on pseudo labels are severely degenerated by noise and prone to overfit to noisy labels, thus are deficient in learning different unlabeled knowledge well. To address this issue, we propose a data-uncertainty guided multi-phase learning method for semi-supervised object detection. We comprehensively consider divergent types of unlabeled images according to their difficulty levels, utilize them in different phases and ensemble models from different phases together to generate ultimate results. Image uncertainty guided easy data selection and region uncertainty guided RoI Re-weighting are involved in multi-phase learning and enable the detector to concentrate on more certain knowledge. Through extensive experiments on PASCAL VOC and MS COCO, we demonstrate that our method behaves extraordinarily compared to baseline approaches and outperforms them by a large margin, more than 3% on VOC and 2% on COCO.
研究动机与目标
- 解决半监督目标检测中的标签噪声过拟合问题,即深度模型生成的噪声伪标签会阻碍从未标注数据中学习。
- 克服单阶段训练方案的局限性,后者无法在不同难度级别的图像之间实现有效学习平衡。
- 通过基于数据不确定性的分阶段训练结构,优先聚焦于更简单、更可靠的样本,从而提升模型泛化能力。
- 通过引入基于区域不确定性的RoI重加权,在训练过程中降低噪声区域的影响,减少特征图中模糊区域的干扰。
- 通过不确定性感知的多阶段学习,有效利用未标注数据,在标准基准上实现SOTA性能。
提出的方法
- 引入图像级不确定性估计,以指导不同训练阶段中未标注图像的选择,优先在早期阶段使用低不确定性(易样本)图像。
- 实施多阶段训练流程,模型按顺序在易样本和难样本上进行训练,使模型能够针对不同难度级别实现专业化学习。
- 基于背景区域之间的相似性和重叠度,测量区域级不确定性,以识别噪声或模糊的区域。
- 在训练过程中使用区域不确定性得分对RoI进行重加权,降低不确定区域的梯度贡献,从而提升对可靠检测的聚焦能力。
- 在推理阶段集成不同阶段的模型,融合来自易样本和难样本的知识,提升整体检测性能。
- 默认采用两阶段学习策略,经验验证表明,在VOC和COCO数据集上,超过两阶段后性能增益已趋于饱和。
实验结果
研究问题
- RQ1与单阶段伪标签方法相比,基于数据不确定性的多阶段训练策略是否能提升半监督目标检测的性能?
- RQ2在不同阶段中分离易样本与难样本的未标注图像,如何影响模型的泛化能力和噪声过拟合?
- RQ3基于区域级不确定性的估计在多大程度上能减轻背景区域中噪声伪标签的影响?
- RQ4在第一阶段中,易样本未标注图像的最优比例是多少,才能在标准基准上最大化mAP?
- RQ5在复杂数据集(如MS COCO)上,将训练阶段数增加到两阶段以上是否能带来显著的性能提升?
主要发现
- 所提方法在PASCAL VOC 2007测试集上达到78.6%的mAP,较之前SOTA方法提升2.4个百分点。
- 在MS COCO minival上,该方法达到42.3%的mAP,较之前SOTA方法提升2.2个百分点。
- 两阶段学习表现最佳,当第一阶段使用约50%的未标注图像时,mAP达到峰值76.8%。
- 当易样本比例超过50%时,性能下降,原因是后期阶段中标签噪声过拟合加剧。
- 扩展到三阶段或四阶段仅带来微小增益(如VOC上达到78.9%),表明超过两阶段后性能增益已出现边际递减。
- 基于区域不确定性的RoI重加权能有效降低模糊背景区域的影响,提升检测可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。