Skip to main content
QUICK REVIEW

[논문 리뷰] SDDGR: Stable Diffusion-based Deep Generative Replay for Class Incremental Object Detection

Junsu Kim, Hoseong Cho|arXiv (Cornell University)|2024. 02. 27.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

이 논문은 COCO 2017에서 70+10 시나리오에서 오래된 카테고리에서 40.9% AP를 기록하며 최신 기술 수준을 달성하는, 새로운 안정된 확산 기반 딥 생성 재생 방법인 SDDGR를 제안한다. 이 방법은 사전 훈련된 텍스트-이미지 확산 모델을 사용해 이전 클래스의 고해상도 합성 이미지를 생성한다. 반복적 개선, L2 지식 정착, 그리고 새로운 작업 이미지 내 오래된 객체에 대한 의사 레이블링을 결합함으로써, 클래스 증분 객체 검출(CIOD)에서 최신 기술 성능을 달성한다.

ABSTRACT

In the field of class incremental learning (CIL), generative replay has become increasingly prominent as a method to mitigate the catastrophic forgetting, alongside the continuous improvements in generative models. However, its application in class incremental object detection (CIOD) has been significantly limited, primarily due to the complexities of scenes involving multiple labels. In this paper, we propose a novel approach called stable diffusion deep generative replay (SDDGR) for CIOD. Our method utilizes a diffusion-based generative model with pre-trained text-to-diffusion networks to generate realistic and diverse synthetic images. SDDGR incorporates an iterative refinement strategy to produce high-quality images encompassing old classes. Additionally, we adopt an L2 knowledge distillation technique to improve the retention of prior knowledge in synthetic images. Furthermore, our approach includes pseudo-labeling for old objects within new task images, preventing misclassification as background elements. Extensive experiments on the COCO 2017 dataset demonstrate that SDDGR significantly outperforms existing algorithms, achieving a new state-of-the-art in various CIOD scenarios. The source code will be made available to the public.

연구 동기 및 목표

  • 새로운 클래스를 학습할 때 이전에 학습한 클래스를 잊는 치명적인 잊음 현상(catastrophic forgetting)을 해결하기 위해.
  • 객체 검출에서 흔한 다중 객체, 다중 레이블 환경에서 기존 생성 재생 방법의 한계를 극복하기 위해.
  • 원래 이미지 생성을 위해 설계된 사전 훈련된 안정된 확산 모델을 활용해 CIOD에서 고품질의 클래스별 합성 데이터를 생성하기 위해.
  • 합성 데이터 생성과 L2 지식 정착, 의사 레이블링을 결합함으로써 증분 학습에서 지식 유지 능력을 향상시키기 위해.
  • 특히 복잡한 다중 객체 환경에서 확산 기반 생성 재생이 기존 방법을 능가할 수 있음을 입증하기 위해.

제안 방법

  • 사전 훈련된 텍스트-이미지 확산 모델(Stable Diffusion)을 사용해 클래스별 프롬프트와 기준 입력을 활용해 이전에 학습한 클래스의 객체를 포함한 합성 이미지를 생성한다.
  • 훈련된 객체 검출기가 검출 신뢰도 기반으로 생성된 이미지를 평가하고 필터링하는 반복적 개선 전략을 적용하여 고해상도 샘플만 유지한다.
  • 품질, 다양성, 계산 비용 간 균형을 맞추기 위해 클래스별로 합성 이미지 생성 수(N개/클래스)를 조절함으로써 저품질 샘플의 과다 생성을 방지한다.
  • 합성 데이터에 기반해 훈련된 교사 모델과 학생 모델 간 L2 지식 정착을 적용하여 직접 엔드 투 엔드 미세조정 없이도 지식을 전이한다.
  • 새로운 작업 이미지에서 검출된 오래된 클래스 객체에 대해 의사 레이블링을 도입하여 훈련 중 배경으로 잘못 분류되지 않도록 보장한다.
  • 이미지 품질과 수량 간 균형을 맞추기 위해 동적 개선 임계값(0.4–0.8)을 사용하며, 실험 분석을 통해 고정 임계값은 성능 저하를 초래함을 확인했다.

실험 결과

연구 질문

  • RQ1사전 훈련된 안정된 확산 모델이 다중 객체 검출 환경에서 고해상도, 클래스별 합성 이미지를 효과적으로 생성하는 데 적합한가?
  • RQ2생성된 이미지에 대한 반복적 개선 전략이 CIOD에서 합성 데이터의 품질과 활용도에 어떤 영향을 미치는가?
  • RQ3증분 학습 환경에서 합성 데이터 훈련에 있어 지식 정착의 최적의 역할은 무엇인가?
  • RQ4새로운 작업 이미지 내 오래된 객체에 대한 의사 레이블링이 배경으로 잘못 분류되는 것을 얼마나 줄이는가?
  • RQ5이미지 생성 수(클래스당) 및 개선 임계값과 같은 하이퍼파라미터가 전체 성능에 어떤 영향을 미치는가?

주요 결과

  • SDDGR는 COCO 2017의 70+10 CIOD 시나리오에서 오래된 카테고리에서 최신 기술 수준인 40.9% AP를 달성하며 새로운 최고 기록을 수립했다.
  • 의사 레이블링은 AP 기준으로 거짓 양성 예측(FPP)을 39.1% 감소시켜 이전에 학습한 클래스의 검출 성능을 크게 향상시켰다.
  • 합성 데이터와 L2 정착의 조합은 모든 카테고리에서 AP를 1.2% 향상시키며 기준 미세조정 대비 FPP를 1.5% 감소시켰다.
  • 가중치 λ=2로 지식 정착을 적용한 경우가 가장 우수한 성능(AP=40.9%)을 기록했으며, 모든 테스트된 λ 값과 이전 최고 기록(40.4%)을 초월했다.
  • 동적 개선 임계값 범위(0.4–0.8)를 사용할 경우 고정 임계값 대비 성능이 1% 향상되었으며, 적응형 필터링의 중요성을 입증했다.
  • 클래스당 100개로 합성 이미지 생성 수를 제한한 경우에도 높은 성능를 유지하면서 생성 시간을 줄여 스케일성과 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.