Skip to main content
QUICK REVIEW

[论文解读] SDDGR: Stable Diffusion-based Deep Generative Replay for Class Incremental Object Detection

Junsu Kim, Hoseong Cho|arXiv (Cornell University)|Feb 27, 2024
Video Surveillance and Tracking Methods被引用 4
一句话总结

该论文提出SDDGR,一种基于稳定扩散的新型稳定扩散深度生成回放方法,用于类别增量目标检测(CIOD),通过使用预训练的文本到图像扩散模型生成旧类别的高保真度合成图像。通过结合迭代优化、L2知识蒸馏以及在新任务图像中对旧类物体进行伪标签化,SDDGR在COCO 2017数据集上实现了SOTA性能,在70+10场景下旧类别AP达到40.9%。

ABSTRACT

In the field of class incremental learning (CIL), generative replay has become increasingly prominent as a method to mitigate the catastrophic forgetting, alongside the continuous improvements in generative models. However, its application in class incremental object detection (CIOD) has been significantly limited, primarily due to the complexities of scenes involving multiple labels. In this paper, we propose a novel approach called stable diffusion deep generative replay (SDDGR) for CIOD. Our method utilizes a diffusion-based generative model with pre-trained text-to-diffusion networks to generate realistic and diverse synthetic images. SDDGR incorporates an iterative refinement strategy to produce high-quality images encompassing old classes. Additionally, we adopt an L2 knowledge distillation technique to improve the retention of prior knowledge in synthetic images. Furthermore, our approach includes pseudo-labeling for old objects within new task images, preventing misclassification as background elements. Extensive experiments on the COCO 2017 dataset demonstrate that SDDGR significantly outperforms existing algorithms, achieving a new state-of-the-art in various CIOD scenarios. The source code will be made available to the public.

研究动机与目标

  • 为解决类别增量目标检测(CIOD)中的灾难性遗忘问题,即模型在学习新类别时遗忘先前学习过的类别。
  • 克服现有生成回放方法在目标检测中常见的多对象、多标签场景下的局限性。
  • 将原本专为图像生成设计的预训练稳定扩散模型适配于CIOD中,实现高质量、类别特定的合成数据生成。
  • 通过结合合成数据生成、L2知识蒸馏与伪标签化,提升增量学习中的知识保留能力。
  • 证明基于扩散的生成回放方法在CIOD中可超越现有方法,尤其在复杂多对象场景中表现更优。

提出的方法

  • 利用预训练的文本到图像扩散模型(Stable Diffusion)通过特定类别提示词与定位输入,生成包含先前学习类别物体的合成图像。
  • 采用迭代优化策略,由训练好的目标检测器根据检测置信度评估并筛选生成图像,仅保留高保真度样本。
  • 实施按类别调控的合成图像生成(每类N张),以平衡质量、多样性与计算成本,避免低质量样本的过度生成。
  • 在学生模型与教师模型(在合成数据上训练)之间应用L2知识蒸馏,实现从合成图像中迁移知识,无需端到端微调。
  • 在新任务图像中对旧类别物体引入伪标签化,确保其在训练过程中不会被误分类为背景。
  • 采用动态优化阈值(0.4–0.8)以平衡图像质量与数量,消融实验表明固定阈值会降低性能。

实验结果

研究问题

  • RQ1预训练的稳定扩散模型能否在多对象检测场景中有效适配,用于生成高保真度、类别特定的合成图像?
  • RQ2对生成图像进行迭代优化如何影响CIOD中合成数据的质量与实用性?
  • RQ3在类别增量设置下,训练合成数据时知识蒸馏的最优作用是什么?
  • RQ4在新任务图像中对旧类物体进行伪标签化在多大程度上可减少其被误分类为背景?
  • RQ5图像生成数量(每类)与优化阈值等超参数如何影响整体性能?

主要发现

  • SDDGR在COCO 2017的70+10 CIOD场景中,旧类别AP达到40.9%,创下新SOTA纪录,超越先前所有方法。
  • 伪标签化使AP中的误报率(FPP)降低39.1%,显著提升对先前学习类别的检测能力。
  • 合成数据与L2蒸馏的结合使所有类别AP提升1.2%,且相比基线微调方法,FPP降低1.5%。
  • 采用知识蒸馏权重λ=2时性能最佳(AP=40.9%),优于所有测试的λ值,并超越此前SOTA的40.4%。
  • 使用动态优化阈值范围(0.4–0.8)相比固定阈值使性能提升1%,凸显自适应过滤的重要性。
  • 将每类合成图像生成数量限制在100张(N=100)可在保持高性能的同时减少生成时间,证明了方法的可扩展性与高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。