Skip to main content
QUICK REVIEW

[论文解读] Technical Report for ICCV 2021 Challenge SSLAD-Track3B: Transformers Are Better Continual Learners

Duo Li, Guimei Cao|arXiv (Cornell University)|Jan 13, 2022
Domain Adaptation and Few-Shot Learning被引用 10
一句话总结

本文提出COLT,一种持续目标检测框架,利用Swin Transformer作为特征提取器以减少灾难性遗忘,结合对250个回放旧样本的知识蒸馏和自适应头扩展以应对领域偏移。该方法在ICCV 2021 SSLAD-Track3B测试集上达到70.78 mAP,凭借Transformer在持续学习设置中卓越的泛化能力和稳定性,在挑战赛中获得第一名。

ABSTRACT

In the SSLAD-Track 3B challenge on continual learning, we propose the method of COntinual Learning with Transformer (COLT). We find that transformers suffer less from catastrophic forgetting compared to convolutional neural network. The major principle of our method is to equip the transformer based feature extractor with old knowledge distillation and head expanding strategies to compete catastrophic forgetting. In this report, we first introduce the overall framework of continual learning for object detection. Then, we analyse the key elements' effect on withstanding catastrophic forgetting in our solution. Our method achieves 70.78 mAP on the SSLAD-Track 3B challenge test set.

研究动机与目标

  • 解决自动驾驶场景中持续目标检测的灾难性遗忘问题。
  • 探究Transformer在持续学习目标检测中是否比CNN泛化能力更优。
  • 在无任务ID泄露的前提下,提升模型在领域偏移场景(白天/夜晚、城市/乡村)下的稳定性。
  • 评估在受限记忆设置(250个样本)下知识蒸馏和自适应头扩展的有效性。
  • 建立基于Transformer架构的持续目标检测新SOTA基线。

提出的方法

  • 使用Swin Transformer作为主干特征提取器,利用其强大的泛化能力及无批归一化层的特性以减少遗忘。
  • 在回放旧样本上对主干和颈部特征应用知识蒸馏,使用固定教师模型,最小化学生与教师网络在特征分布上的差异。
  • 采用250个旧样本的记忆缓冲区进行知识蒸馏,KD损失定义为教师与学生网络特征图之间的L2距离。
  • 当新场景验证损失超过阈值(1.2)时,自适应扩展检测头,实现对大领域差距场景的独立头专业化。
  • 使用CascadeRCNN作为检测头,训练配置为8张GPU,监督损失与知识蒸馏损失的比例为1:20。
  • 引入基于任务ID的推理机制,在测试时根据场景身份选择合适检测头。

实验结果

研究问题

  • RQ1与CNN相比,使用Transformer主干是否能减少持续目标检测中的灾难性遗忘?
  • RQ2在有限记忆缓冲区(250个样本)下,知识蒸馏在保持旧任务性能方面的有效性如何?
  • RQ3自适应头扩展是否能缓解如夜间驾驶等分布外场景下的性能退化?
  • RQ4模型大小是否单独决定持续学习性能,还是主干特征提取器的泛化能力更为关键?
  • RQ5生成式回放技术能否在持续学习的目标检测中有效应用?

主要发现

  • 所提出的COLT方法在SSLAD-Track3B测试集上达到70.78 mAP,比挑战赛基线高出19.58 mAP。
  • 使用Swin Transformer主干相比CNN显著降低了遗忘,表现为更低的遗忘率(FR)和更高的平均AP。
  • 知识蒸馏将遗忘率从1.71降至0.46,同时将验证集上的平均AP从73.59提升至75.11。
  • 自适应头扩展在任务3(夜间驾驶)中显著提升了性能,该任务存在较大领域差距,证明其在处理领域偏移方面的有效性。
  • 尽管参数更大的ResNet101模型表现更差,归因于过拟合,但基于Transformer的模型优于所有CNN基线,表明主干的泛化能力比模型大小更为关键。
  • 使用VAE和GAN的生成式回放效果不佳,原因在于长尾生成、纵横比变化及目标检测中特征质量的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。