Skip to main content
QUICK REVIEW

[논문 리뷰] Technical Report for ICCV 2021 Challenge SSLAD-Track3B: Transformers Are Better Continual Learners

Duo Li, Guimei Cao|arXiv (Cornell University)|2022. 01. 13.
Domain Adaptation and Few-Shot Learning인용 수 10
한 줄 요약

이 논문은 재난적 기억 상실을 줄이기 위해 스위니 트랜스포머를 특징 추출기로 활용하는 지속적 객체 검출 프레임워크인 COLT을 제안한다. 이는 250개의 재생된 이전 샘플에 대해 지식 정복을 통합하고 도메인 이동에 대응하기 위해 적응형 헤드 확장을 결합한다. 이 방법은 ICCV 2021 SSLAD-Track3B 테스트 세트에서 70.78 mAP를 기록하여 트랜스포머가 지속적 학습 환경에서 뛰어난 일반화 능력과 안정성을 보여주며 대회에서 1등을 차지했다.

ABSTRACT

In the SSLAD-Track 3B challenge on continual learning, we propose the method of COntinual Learning with Transformer (COLT). We find that transformers suffer less from catastrophic forgetting compared to convolutional neural network. The major principle of our method is to equip the transformer based feature extractor with old knowledge distillation and head expanding strategies to compete catastrophic forgetting. In this report, we first introduce the overall framework of continual learning for object detection. Then, we analyse the key elements' effect on withstanding catastrophic forgetting in our solution. Our method achieves 70.78 mAP on the SSLAD-Track 3B challenge test set.

연구 동기 및 목표

  • 자율주행 시나리오에서 지속적 객체 검출의 재난적 기억 상실 문제를 해결하기 위해.
  • 지속적 학습에서 트랜스포머가 CNN보다 일반화 능력이 뛰어나지 않는지 조사하기 위해.
  • 태스크 ID 泄露 없이 도메인 이동 시나리오(낮/밤, 도심/농촌)에서도 모델의 안정성을 향상시키기 위해.
  • 제한된 메모리 환경(250개 샘플)에서 지식 정복과 적응형 헤드 확장의 효과성을 평가하기 위해.
  • 트랜스포머 기반 아키텍처를 사용한 지속적 객체 검출의 새로운 SOTA 베이스라인을 수립하기 위해.

제안 방법

  • 강력한 일반화 능력과 배치 정규화 레이어가 없어 기억 상실을 줄이는 특징으로 스위니 트랜스포머를 백본 특징 추출기로 사용한다.
  • 고정된 테이처 모델을 사용해 재생된 이전 샘플에서 학생 및 테이처 네트워크의 특징 분포 차이를 최소화하기 위해 백본 및 넥 특징에 대해 지식 정복을 적용한다.
  • 지식 정복을 위해 250개의 이전 샘플을 저장하는 메모리 버퍼를 사용하며, KD 손실은 테이처 및 학생 네트워크의 특징 맵 간 L2 거리로 정의된다.
  • 새로운 시나리오에서 검증 손실이 임계값(1.2)을 초과할 경우 검출기 헤드를 적응적으로 확장하여 큰 도메인 간격에 대응하는 별도의 헤드 특화를 가능하게 한다.
  • 카스케이드RCNN을 검출기 헤드로 사용하며, 8개 GPU에서 학습을 수행하고 감독 학습과 지식 정복 손실 간 비율을 1:20으로 설정한다.
  • 태스크 ID에 따라 다를 수 있는 추론 메커니즘을 도입하여, 시나리오 식별자에 따라 테스트 시 적절한 헤드를 선택한다.

실험 결과

연구 질문

  • RQ1지속적 객체 검출에서 트랜스포머 백본을 사용할 경우 CNN에 비해 재난적 기억 상실이 줄어드는가?
  • RQ2제한된 메모리 버퍼(250개 샘플)에서 지식 정복이 이전 태스크 성능 유지에 얼마나 효과적인가?
  • RQ3적응형 헤드 확장은 야간 주행과 같은 도메인 외 시나리오에서 성능 저하를 완화하는가?
  • RQ4모델 크기 자체가 지속적 학습 성능을 결정짓는가, 아니면 특징 추출기의 일반화 능력이 더 중요한가?
  • RQ5지속적 학습에서 객체 검출에 대해 생성형 재생 기법을 효과적으로 적용할 수 있는가?

주요 결과

  • 제안된 COLT 방법은 SSLAD-Track3B 테스트 세트에서 70.78 mAP를 기록하여 대회 기준선보다 19.58 mAP 높게 달성했다.
  • 스위니 트랜스포머 백본을 사용함으로써 CNN에 비해 기억 상실이 줄었으며, 이는 더 낮은 기억 상실률(FR)과 더 높은 평균 mAP로 확인되었다.
  • 지식 정복을 통해 검증 세트에서 기억 상실률은 1.71에서 0.46으로 감소했고, 평균 mAP는 73.59에서 75.11로 상승했다.
  • 큰 도메인 간격을 가진 Task 3(야간 주행)에서 적응형 헤드 확장으로 성능 향상이 뚜렷하게 나타나 도메인 이동에 대응하는 데 효과적임을 입증했다.
  • ResNet101 기반의 더 큰 모델은 과적합으로 인해 더 작은 모델보다 성능이 열 劣했지만, 트랜스포머 기반 모델은 모든 CNN 기준선을 초월해 백본의 일반화 능력이 크기보다 더 중요함을 시사했다.
  • VAE와 GAN을 사용한 생성형 재생은 객체 검출에서 비율 변화, 긴 꼬리 생성, 특징 품질 문제로 인해 효과적이지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.