[论文解读] Dense Teacher: Dense Pseudo-Labels for Semi-supervised Object Detection
本文提出Dense Teacher,一种半监督目标检测框架,用直接从教师模型原始输出中提取的密集伪标签(DPLs)替代稀疏伪框,消除了NMS和阈值处理等后处理步骤。通过引入区域选择策略以抑制噪声并突出显示困难负样本,Dense Teacher在COCO和VOC基准上实现了最先进性能,相较于基于伪框的方法在标准设置下mAP提升高达3.2%。
To date, the most powerful semi-supervised object detectors (SS-OD) are based on pseudo-boxes, which need a sequence of post-processing with fine-tuned hyper-parameters. In this work, we propose replacing the sparse pseudo-boxes with the dense prediction as a united and straightforward form of pseudo-label. Compared to the pseudo-boxes, our Dense Pseudo-Label (DPL) does not involve any post-processing method, thus retaining richer information. We also introduce a region selection technique to highlight the key information while suppressing the noise carried by dense labels. We name our proposed SS-OD algorithm that leverages the DPL as Dense Teacher. On COCO and VOC, Dense Teacher shows superior performance under various settings compared with the pseudo-box-based methods.
研究动机与目标
- 为解决基于伪框的半监督目标检测方法存在的局限性,这些方法依赖于易出错的后处理步骤(如NMS和阈值处理)以及对敏感超参数的依赖。
- 提出一种统一的、端到端的伪标签形式,以保留教师模型原始输出中的更丰富信息。
- 通过有选择地从密集预测中的高质量、困难负样本区域学习,提升模型泛化能力。
- 证明当与智能区域选择结合时,密集伪标签相较于传统伪框流程可实现更优性能。
提出的方法
- 密集伪标签(DPLs)直接从教师模型的原始输出生成,无需任何后处理,完整保留空间位置和置信度信息。
- 学生模型在标注数据的真实标签和未标注数据的DPLs上进行训练,采用数据增强的的一致性正则化方案。
- 通过区域划分策略,选择高置信度和困难负样本区域(例如特征金字塔网络FPN层的1%)作为学习重点,抑制低分噪声预测。
- 教师模型通过学生模型的指数移动平均(EMA)进行维护,确保训练过程中伪标签生成的稳定性。
- 无监督损失使用可学习因子$ w_u $加权,根据数据可用性动态调整,以平衡监督与无监督信号。
- 该方法在单阶段检测器(FCOS、RetinaNet)和多个数据集(COCO、VOC、CrowdedHuman)上进行了评估,展现出良好的鲁棒性与泛化能力。
实验结果
研究问题
- RQ1用密集伪标签替代稀疏伪框是否能通过消除后处理瓶颈,提升半监督目标检测性能?
- RQ2从密集预测中选择关键区域如何影响模型学习与性能表现?
- RQ3所提出的区域选择策略是否能有效抑制噪声,同时保留具有信息量的困难负样本?
- RQ4学习区域大小和无监督损失权重等超参数如何影响模型收敛与准确率?
- RQ5Dense Teacher框架是否在不同检测器架构和数据集上均具备泛化能力?
主要发现
- 在COCO-Standard 10%设置下,Dense Teacher达到35.11 mAP,相比之前最先进方法Unbiased Teacher提升3.2% mAP。
- 在COCO-Full设置下,Dense Teacher达到44.92 mAP,即使在大量标注数据下也表现出强劲性能。
- 区域选择策略相比完全抑制噪声和忽略困难负样本,分别使mAP提升1.47%和2.47%,证明其有效性。
- 最优学习区域大小为FPN层的1%(即5层),该区域同时包含正样本和有价值的困难负样本。
- 在低标注数据设置(COCO-10%)下,较高的无监督损失权重($ w_u = 4 $)为最优;而在全量数据设置下,$ w_u = 2 $已足够。
- 该方法可泛化至基于锚点的检测器(RetinaNet)及其他数据集(CrowdedHuman),分别实现+2.2% mAP和+2.1% mMR的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。