[论文解读] Dense Learning based Semi-Supervised Object Detection
本文提出 DenSe Learning (DSL),这是首个采用密集像素级伪标签与自适应过滤、聚合教师模型以实现稳定预测,并在不同尺度和打乱图像块之间应用不确定性一致性正则化的无锚点半监督目标检测方法。DSL 在 MS-COCO 和 PASCAL-VOC 上实现了最先进性能,在半监督设置下达到 36.2 mAP 的准确率,显著超越以往方法。
Semi-supervised object detection (SSOD) aims to facilitate the training and deployment of object detectors with the help of a large amount of unlabeled data. Though various self-training based and consistency-regularization based SSOD methods have been proposed, most of them are anchor-based detectors, ignoring the fact that in many real-world applications anchor-free detectors are more demanded. In this paper, we intend to bridge this gap and propose a DenSe Learning (DSL) based anchor-free SSOD algorithm. Specifically, we achieve this goal by introducing several novel techniques, including an Adaptive Filtering strategy for assigning multi-level and accurate dense pixel-wise pseudo-labels, an Aggregated Teacher for producing stable and precise pseudo-labels, and an uncertainty-consistency-regularization term among scales and shuffled patches for improving the generalization capability of the detector. Extensive experiments are conducted on MS-COCO and PASCAL-VOC, and the results show that our proposed DSL method records new state-of-the-art SSOD performance, surpassing existing methods by a large margin. Codes can be found at extcolor{blue}{https://github.com/chenbinghui1/DSL}.
研究动机与目标
- 为解决无锚点检测器缺乏有效的半监督目标检测(SSOD)方法的问题,此类检测器在实际部署中更具实用性。
- 通过显式处理背景、前景和可忽略区域,利用自适应过滤提升无锚点检测器中密集伪标签的质量。
- 通过结合层间聚合与指数移动平均(EMA)参数聚合的聚合教师模型,提升伪标签的稳定性和准确性。
- 通过在不同图像尺度和打乱图像块之间应用不确定性一致性正则化,提升模型泛化能力。
- 在 MS-COCO 和 PASCAL-VOC 等标准基准上建立无锚点 SSOD 的新最先进基线。
提出的方法
- 自适应过滤(AF)使用多级阈值将密集伪标签划分为三类——背景、前景和可忽略区域,并采用每类自适应的阈值以提升准确性。
- 引入 MetaNet 通过过滤掉高分但错误的预测,进一步优化前景伪标签,减少误报。
- 聚合教师(AT)结合层间特征聚合(LA)与 EMA,以在训练迭代过程中稳定并提升伪标签质量。
- 在不同图像尺度和打乱图像块之间应用不确定性一致性正则化,通过强制特征不确定性的一致性,提升模型鲁棒性与泛化能力。
- 损失函数结合了标注数据上的监督损失与未标注数据上的加权一致性损失,其中超参数 α 控制未标注数据的影响。
- 该方法基于 FCOS 作为无锚点基线模型,利用其密集预测头实现像素级监督。
实验结果
研究问题
- RQ1能否在高质量伪标签支持下,有效将密集无锚点目标检测方法适配至半监督学习?
- RQ2多级、细粒度的伪标签划分(背景/前景/可忽略)在无锚点 SSOD 中如何提升性能?
- RQ3结合 EMA 与层间聚合的聚合教师模型对伪标签稳定性和准确性有何影响?
- RQ4在不同尺度和打乱图像块之间应用不确定性一致性正则化,在无锚点 SSOD 中对泛化能力的提升程度如何?
- RQ5所提出的 DSL 方法是否在 MS-COCO 和 PASCAL-VOC 等标准基准上实现了半监督设置下的最先进性能?
主要发现
- 所提出的 DSL 方法在 MS-COCO 的半监督目标检测设置下达到 36.2 mAP,显著优于现有最先进方法。
- 消融实验表明,AF、MetaNet、AT 以及图像块打乱/一致性正则化等各组件对性能均有逐步贡献,完整模型达到 36.2 mAP。
- 采用类特定阈值的自适应过滤使 mAP 从基线的 23.7 提升至 32.2,证明了细粒度伪标签划分的有效性。
- 同时结合 EMA 与层聚合的聚合教师(AT)达到 36.2 mAP,优于仅使用 EMA(34.1 mAP)或仅使用 LA(35.0 mAP)的设置,证明二者具有互补性。
- 未标注数据损失权重 α 的最优值为 3;更高值(如 4)会导致训练不稳定与损失发散。
- 该方法在无锚点 SSOD 领域树立了新 SOTA,是该方向的首次成功尝试,并在 COCO 和 VOC 上取得了强有力的实证结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。