Skip to main content
QUICK REVIEW

[논문 리뷰] Faster ILOD: Incremental Learning for Object Detectors based on Faster RCNN

Can Peng, Kun Zhao|arXiv (Cornell University)|2020. 03. 09.
Domain Adaptation and Few-Shot Learning참고 문헌 24인용 수 6
한 줄 요약

이 논문은 Faster R-CNN 기반의 엔드 투 엔드 인크리멘탈 오브젝트 디텍션 프레임워크인 Faster ILOD를 제안하며, 다중 네트워크 적응형 디스틸레이션을 통해 치명적인 잊음 문제를 완화합니다. RPN의 빈번한 애너테이션 누락에 대한 강건성과 다중 네트워크 간 지식 디스틸레이션을 활용하여, PASCAL VOC 및 COCO 데이터셋에서 기존 방법 대비 13배 빠른 추론 속도와 최대 5.92% 높은 평균 정밀도를 달성합니다.

ABSTRACT

The human vision and perception system is inherently incremental where new knowledge is continually learned over time whilst existing knowledge is retained. On the other hand, deep learning networks are ill-equipped for incremental learning. When a well-trained network is adapted to new categories, its performance on the old categories will dramatically degrade. To address this problem, incremental learning methods have been explored which preserve the old knowledge of deep learning models. However, the state-of-the-art incremental object detector employs an external fixed region proposal method that increases overall computation time and reduces accuracy comparing to Region Proposal Network (RPN) based object detectors such as Faster RCNN. The purpose of this paper is to design an efficient end-to-end incremental object detector using knowledge distillation. We first evaluate and analyze the performance of the RPN-based detector with classic distillation on incremental detection tasks. Then, we introduce multi-network adaptive distillation that properly retains knowledge from the old categories when fine-tuning the model for new task. Experiments on the benchmark datasets, PASCAL VOC and COCO, demonstrate that the proposed incremental detector based on Faster RCNN is more accurate as well as being 13 times faster than the baseline detector.

연구 동기 및 목표

  • 기존 학습 데이터에 접근할 수 없는 상황에서 새로운 클래스가 추가될 때 오브젝트 디텍터에서 발생하는 치명적인 잊음 문제를 해결합니다.
  • 외부 고정형 영역 제안 네트워크에 의존하는 기존 인크리멘탈 디텍터의 한계를 극복하며, 이는 추론 속도 저하와 정확도 감소를 초래합니다.
  • 기존 클래스 성능을 유지하면서 새로운 클래스를 효율적으로 학습할 수 있는 엔드 투 엔드, RPN 기반의 인크리멘탈 디텍션 프레임워크를 설계합니다.
  • 기존 데이터가 이용 불가능하거나 재애너테이션이 비현실적인 실세계 환경에서의 일반화 능력과 강건성을 향상시킵니다.
  • 다중 네트워크 적응형 디스틸레이션이 인크리멘탈 편집 학습 중 이전 클래스의 지식을 효과적으로 유지하는지 입증합니다.

제안 방법

  • 기존 클래스에 대한 애너테이션 누락에 대한 RPN의 내재된 강건성을 인크리멘탈 디텍션 환경에서 평가하여, 앵커 기반 제안 메커니즘이 부분적 레이블링을 수용할 수 있음을 발견합니다.
  • 외부 제안 네트워크를 대체하기 위해 훈련 가능한 RPN을 탑재한 Faster R-CNN 기반의 엔드 투 엔드 인크리멘탈 학습 프레임워크인 Faster ILOD를 제안합니다.
  • 편집 학습 중에 이전 여러 모델 버전으로부터 현재 모델로 지식을 전달하는 다중 네트워크 적응형 디스틸레이션을 구현합니다.
  • 오래된 모델의 소프트 레이블을 현재 디텍터로 전달하여, 기존 클래스의 검출 신뢰도와 특징 표현을 유지합니다.
  • 현재 모델과 이전 모델 뿐 아니라, 여러 이전 모델 간에도 디스틸레이션 손실을 적용하여 지식 유지의 안정성을 높입니다.
  • 오직 새로운 클래스 애너테이션만을 사용하여 전체 Faster R-CNN 네트워크를 엔드 투 엔드로 편집 학습하며, 디스틸레이션된 지식을 활용해 기억 상실을 방지합니다.

실험 결과

연구 질문

  • RQ1Faster R-CNN의 RPN은 인크리멘탈 오브젝트 디텍션 중 기존 클래스의 애너테이션 누락에 대해 어느 정도 견딜 수 있나요?
  • RQ2다중 네트워크 적응형 디스틸레이션은 인크리멘탈 학습 중에 이전에 학습된 클래스의 검출 성능 유지를 얼마나 효과적으로 수행합니까?
  • RQ3외부 고정형 영역 제안 네트워크에 의존하는 기존 방법에 비해, 엔드 투 엔드 RPN 기반의 인크리멘탈 디텍터는 속도와 정확도 측면에서 더 우수한 성능을 보이나요?
  • RQ4다양한 인크리멘탈 학습 순서와 클래스 난이도 수준에서 제안된 방법의 성능는 어떻게 변화합니까?
  • RQ5기존 클래스의 높은 정확도를 유지하면서 치명적인 잊음 문제를 어느 정도 줄일 수 있나요?

주요 결과

  • Faster R-CNN의 RPN은 앵커 기반 제안 메커니즘 덕분에 기존 클래스의 애너테이션 누락에 대해 내재된 강건성을 보이며, 부분적 레이블링이 가능한 인크리멘탈 훈련을 가능하게 합니다.
  • Faster ILOD는 외부 제안을 사용하는 Fast R-CNN 기반 ILOD 대비 13배 빠른 추론 속도를 달성하여, ResNet-50 기반 VOC에서 이미지당 평균 검출 시간을 1396.66 ms에서 109.52 ms로 감소시킵니다.
  • PASCAL VOC에서 Faster ILOD는 ILOD 대비 평균 mAP 5.78% 향상과, Faster R-CNN에 적용된 ILOD 대비 1.67% 향상을 기록하며, 다단계 인크리멘탈 학습(한 번에 한 클래스씩 추가)에서 성능을 확보합니다.
  • COCO에서 Faster ILOD는 ILOD 대비 5.92% mAP 향상과, Faster R-CNN에 적용된 ILOD 대비 2.74% 향상을 기록하며, 더 높은 IoU 임계치에서도 추가적인 성능 향상을 보입니다 (IoU=0.5 기준).
  • 다양한 학습 순서에서 일관된 성능 향상을 보이며, 특히 다른 클래스와 자주 공존하는 어려운 카테고리인 'person'을 학습할 때 가장 높은 성능 향상을 기록합니다.
  • 기존 데이터가 부족하거나 애너테이션이 누락된 경우에 적응형 디스틸레이션 메커니즘이 가장 효과적이며, 이는 애너테이션 누락 비율이 높고 대규모 훈련 세트를 가진 카테고리에서 더 높은 성능 향상을 보여줍니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.