Skip to main content
QUICK REVIEW

[논문 리뷰] Scale-Equivalent Distillation for Semi-Supervised Object Detection

Qiushan Guo, Yao Mu|arXiv (Cornell University)|2022. 03. 23.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 대규모 객체 크기 변동성, 가짜 음성 샘플, 클래스 불균형 문제를 해결하기 위해 반감기 크기 일관성과 재가중 처리를 통한 자기-디스틸리케이션을 통합한 새로운 엔드 투 엔드 지식 디스틸리케이션 프레임워크인 Scale-Equivalent Distillation (SED)을 제안한다. 특징 맵 간의 크기 일관성과 재가중 처리를 통한 자기-디스틸리케이션을 적용함으로써 SED는 MS-COCO에서 라벨이 부여된 데이터가 5%와 10%일 경우에도 감독 기반 모델보다 10 mAP 이상 뛰어난 최신 기술 성능을 달성한다.

ABSTRACT

Recent Semi-Supervised Object Detection (SS-OD) methods are mainly based on self-training, i.e., generating hard pseudo-labels by a teacher model on unlabeled data as supervisory signals. Although they achieved certain success, the limited labeled data in semi-supervised learning scales up the challenges of object detection. We analyze the challenges these methods meet with the empirical experiment results. We find that the massive False Negative samples and inferior localization precision lack consideration. Besides, the large variance of object sizes and class imbalance (i.e., the extreme ratio between background and object) hinder the performance of prior arts. Further, we overcome these challenges by introducing a novel approach, Scale-Equivalent Distillation (SED), which is a simple yet effective end-to-end knowledge distillation framework robust to large object size variance and class imbalance. SED has several appealing benefits compared to the previous works. (1) SED imposes a consistency regularization to handle the large scale variance problem. (2) SED alleviates the noise problem from the False Negative samples and inferior localization precision. (3) A re-weighting strategy can implicitly screen the potential foreground regions of the unlabeled data to reduce the effect of class imbalance. Extensive experiments show that SED consistently outperforms the recent state-of-the-art methods on different datasets with significant margins. For example, it surpasses the supervised counterpart by more than 10 mAP when using 5% and 10% labeled data on MS-COCO.

연구 동기 및 목표

  • 반감기 객체 검출에서 큰 객체 크기 변동성이 모델 일반화 능력을 저하시키는 문제를 해결한다.
  • 어려운 가짜 레이블에서 발생하는 가짜 음성 예측과 정확도가 떨어지는 위치 지정으로 인한 노이즈를 줄인다.
  • 비라벨 데이터의 전경과 배경 영역 간 심각한 클래스 불균형 문제를 완화한다.
  • 간단한 엔드 투 엔드 디스틸리케이션 프레임워크를 통해 저감도 감독 환경에서도 검출 성능을 향상시킨다.
  • 다중 크기 추론 앙상블에 의존하지 않고도 다양한 입력 크기에서 일관된 예측을 가능하게 한다.

제안 방법

  • 동일 객체의 서로 다른 크기에서의 예측 간 특징 수준의 일관성을 강제함으로써 크기 일관성 정규화를 도입한다.
  • 교사와 학생의 예측 간 일치를 유도함으로써 가짜 음성 샘플에서 기인하는 노이즈를 줄이기 위해 자기-디스틸리케이션을 적용한다.
  • 비라벨 데이터에서 배경 영역의 가중치를 낮추고 잠재적 전경 영역을 강조하기 위해 재가중 전략을 구현한다.
  • 학생 모델이 라벨이 부여된 데이터와 비라벨 데이터에서 교사로부터 얻은 지식을 디스틸리케이션하여 학습하는 엔드 투 엔드 학습 파이프라인을 설계한다.
  • 특징 맵과 바운딩 박스 회귀 기반의 일관성 손실을 사용하여 특징 피라미드 수준 간의 크기 등가성(스케일 인variant)을 유지한다.
  • 검출 정확도와 크기 불변성 최적화를 동시에 고려하는 학생-교사 프레임워크를 활용한 지식 디스틸리케이션을 활용한다.

실험 결과

연구 질문

  • RQ1다양한 입력 크기에서의 크기 비일관성이 반감기 설정에서 객체 검출 성능을 어떻게 악화시키는가?
  • RQ2어려운 가짜 레이블에서 발생하는 가짜 음성 예측과 위치 오차는 기존의 자기학습 방법의 성능을 어느 정도 제한하는가?
  • RQ3재가중 메커니즘이 비라벨 데이터에서 극심한 전경-배경 클래스 불균형의 영향을 효과적으로 줄일 수 있는가?
  • RQ4크기 등가 지식 디스틸리케이션을 강제 적용함으로써 다양한 객체 크기에서 일관되고 강건한 검출이 가능해지는가?
  • RQ5간단한 엔드 투 엔드 디스틸리케이션 프레임워크가 반감기 객체 검출에서 복잡한 다단계 자기학습 파이프라인을 능가할 수 있는가?

주요 결과

  • MS-COCO에서 라벨이 부여된 데이터가 5%일 경우 SED는 감독 기반의 RetinaNet 기준보다 10.2 mAP 향상된 성능을 달성한다.
  • 라벨이 부여된 데이터가 10%일 경우 SED는 MS-COCO에서 감독 기반 모델 대비 mAP가 10.8 포인트 향상된다.
  • 절단 분석 결과에서 SED는 가짜 음성 비율을 크게 감소시켰으며, IoU=0.9일 때 재현율이 0.2 이하에서 0.4 이상으로 상승했다.
  • 크기 일관성 정규화는 다양한 입력 크기 간 예측 변동성을 줄여 크기 변화에 대한 강건성을 향상시켰다.
  • 재가중 전략은 배경 기울기 우세 현상을 효과적으로 억제하여 전경 특징 학습을 향상시켰다.
  • SED는 다양한 라벨 데이터 설정에서 MS-COCO, Pascal VOC, COCO-100 모두에서 최신 기술 수준의 방법들을 일관되게 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.