Skip to main content
QUICK REVIEW

[论文解读] Revisiting Knowledge Distillation for Object Detection

Amin Banitalebi-Dehkordi|arXiv (Cornell University)|May 22, 2021
Advanced Neural Network Applications参考文献 39被引用 6
一句话总结

本文提出了一种用于目标检测的解耦知识蒸馏框架,该框架首先使用无标签数据中教师模型生成的伪标签训练学生模型,随后再利用有标签数据进行微调。该方法在减少有标签数据使用量的情况下实现了性能提升,支持跨非重叠目标类别的多教师蒸馏,并可实现领域自适应,在结合无标签数据时,仅使用20%的COCO标注数据即可达到62.69%的mAP。

ABSTRACT

The existing solutions for object detection distillation rely on the availability of both a teacher model and ground-truth labels. We propose a new perspective to relax this constraint. In our framework, a student is first trained with pseudo labels generated by the teacher, and then fine-tuned using labeled data, if any available. Extensive experiments demonstrate improvements over existing object detection distillation algorithms. In addition, decoupling the teacher and ground-truth distillation in this framework provides interesting properties such: as 1) using unlabeled data to further improve the student's performance, 2) combining multiple teacher models of different architectures, even with different object categories, and 3) reducing the need for labeled data (with only 20% of COCO labels, this method achieves the same performance as the model trained on the entire set of labels). Furthermore, a by-product of this approach is the potential usage for domain adaptation. We verify these properties through extensive experiments.

研究动机与目标

  • 解决现有目标检测蒸馏方法在训练过程中需要同时依赖教师模型和真实标签的局限性。
  • 在仅拥有预训练教师模型、无法访问完整标注数据集的情况下,实现有效的蒸馏。
  • 探索将具有不同架构和目标类别集合的多个教师模型联合用于学生模型训练的可行性。
  • 研究无标签数据在提升学生模型泛化能力方面的作用,超越传统的监督微调。
  • 评估该方法在低资源或领域分布偏移场景下的领域自适应潜力。

提出的方法

  • 首先使用无标签数据池中教师模型生成的伪标签对学生模型进行训练,将蒸馏过程与真实标签监督解耦。
  • 通过将无标签图像输入教师模型生成伪标签,输出包括边界框、置信度分数和类别概率。
  • 使用蒸馏损失函数,使学生模型在边界框预测、置信度分数和类别概率方面与教师模型输出保持一致。
  • 在伪标签生成阶段引入特征匹配和模仿掩码技术,以提升生成标签的质量。
  • 在无监督蒸馏之后,若存在有标签数据子集,则对学生模型进行微调以进一步提升性能。
  • 在多教师蒸馏中,采用“肯定”策略聚合多个教师的预测结果,即只要教师之间存在一致意见,即视为有效预测,即使在不同类别之间也适用。

实验结果

研究问题

  • RQ1在微调前先使用教师模型生成的伪标签对学生模型进行预训练,是否能够提升蒸馏性能?
  • RQ2在蒸馏过程中使用无标签数据是否能带来可测量的性能增益?
  • RQ3能否有效结合多个具有不同架构和目标类别的教师模型来训练单一学生模型?
  • RQ4当目标领域中缺乏或完全无标注数据时,该框架在多大程度上支持领域自适应?
  • RQ5特征匹配、模仿掩码和边界框匹配等技术在所提框架中对最终检测性能有何影响?

主要发现

  • 仅使用COCO训练集20%的标注数据,结合无标签数据,所提方法在mAP上达到62.69%,与使用完整数据集训练的模型性能相当。
  • 在无监督蒸馏后,通过有标签数据微调,该方法在平均mAP上相比无蒸馏训练提升了2.6%。
  • 当使用三个检测非重叠类别(Person-Car、Car-Cat、Person-Bicycle)的教师模型时,学生模型在COCO数据集上微调后的mAP达到60.08%,显著优于仅使用蒸馏的基线模型(52.50%)。
  • 在领域自适应任务中,经由白天图像教师模型蒸馏并结合夜间图像微调后,该方法在夜间图像上的mAP达到45.78%,超过基线模型的33.25%。
  • 在聚合教师预测结果后应用NMS会降低性能,表明噪声伪标签有助于学生模型学习更鲁棒的特征。
  • 通过采用肯定聚合策略,该方法能够有效实现来自不同架构和类别集合的多个教师模型的蒸馏,即使在无类别重叠的情况下亦可实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。