Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Efficient Detector with Semi-supervised Adaptive Distillation

Shitao Tang, Litong Feng|arXiv (Cornell University)|2019. 01. 02.
Advanced Neural Network Applications참고 문헌 20인용 수 14
한 줄 요약

이 논문은 단일 단계 객체 검출기에서 교사 네트워크의 소프트 레이블을 사용하여 학습이 어려운 샘플과 모방이 어려운 샘플을 적응적으로 가중하는 지식 증류 방법인 준지도 학습 적응 증류(SAD)를 제안한다. 어려운 샘플에 초점을 맞추고, 소프트 타겟을 사용해 미레이블 데이터를 활용함으로써 SAD는 ResNet-50 학생 모델이 COCO에서 90ms 추론 시간에 36.9 mAP를 달성하며 ResNet-101 교사 모델을 능가하게 한다—이전 모델보다 더 빠르고 정확하다.

ABSTRACT

Knowledge Distillation (KD) has been used in image classification for model compression. However, rare studies apply this technology on single-stage object detectors. Focal loss shows that the accumulated errors of easily-classified samples dominate the overall loss in the training process. This problem is also encountered when applying KD in the detection task. For KD, the teacher-defined hard samples are far more important than any others. We propose ADL to address this issue by adaptively mimicking the teacher's logits, with more attention paid on two types of hard samples: hard-to-learn samples predicted by teacher with low certainty and hard-to-mimic samples with a large gap between the teacher's and the student's prediction. ADL enlarges the distillation loss for hard-to-learn and hard-to-mimic samples and reduces distillation loss for the dominant easy samples, enabling distillation to work on the single-stage detector first time, even if the student and the teacher are identical. Besides, ADL is effective in both the supervised setting and the semi-supervised setting, even when the labeled data and unlabeled data are from different distributions. For distillation on unlabeled data, ADL achieves better performance than existing data distillation which simply utilizes hard targets, making the student detector surpass its teacher. On the COCO database, semi-supervised adaptive distillation (SAD) makes a student detector with a backbone of ResNet-50 surpasses its teacher with a backbone of ResNet-101, while the student has half of the teacher's computation complexity. The code is avaiable at https://github.com/Tangshitao/Semi-supervised-Adaptive-Distillation

연구 동기 및 목표

  • 지식 증류가 단일 단계 검출기에서 비효율적인 이유를 해결하기 위해, 쉽게 학습되는 샘플이 손실 함수를 지배하고 어려운 샘플이 충분히 고려되지 않는 문제를 해결한다.
  • 학생과 교사 네트워크가 동일하거나 레이블이 있는 데이터와 없는 데이터가 서로 다른 분포를 가질 때에도 효과적인 지식 증류를 가능하게 한다.
  • 레이블이 없는 데이터에 대해 교사의 소프트 레이블을 사용함으로써 준지도 학습 객체 검출을 향상시킨다. 하드 타겟 대신 소프트 타겟을 사용한다.
  • 학습 불확실성(학습이 어려운 것)과 예측 갭(모방이 어려운 것)을 기반으로 증류 가중치를 적응적으로 조정하는 방법을 개발한다. 이를 통해 어려운 샘플에서의 증류 성능을 향상시킨다.

제안 방법

  • 학습이 어려운 샘플(교사 예측에서 높은 불확실성)과 모방이 어려운 샘플(교사와 학생의 예측 갭이 큰)이라는 두 가지 유형의 어려운 샘플을 기반으로 동적으로 증류 가중치를 조정하는 적응 증류 손실(ADL)을 제안한다.
  • ADL은 학습이 어려운 샘플과 모방이 어려운 샘플에 대해 손실을 증가시키고, 쉽게 학습되는 샘플에 대해서는 손실을 감소시켜, 쉽게 학습되는 샘플이 학습 목표를 지배하지 않도록 한다.
  • ADL을 지도 학습 및 준지도 학습 설정 모두에 적용하여, 레이블이 없는 데이터에 대해 교사의 소프트 레이블을 사용해 학생 모델을 안내한다.
  • 레이블이 없는 데이터에 대한 데이터 선택 전략을 도입하여, 교사가 적어도 하나의 객체를 검출하는 이미지(양성 반응)를 우선순위로 정하여 증류 효율을 높인다.
  • 레이블이 없는 데이터에 대해 교사 모델의 소프트 타겟(로짓)을 사용해 지도 신호를 제공함으로써, 학생이 예측 가능한 하드 타겟으로 인해 발생하는 비효율성을 방지한다.
  • 학생 모델을 레이블이 있는 데이터(정답 레이블)와 레이블이 없는 데이터(소프트 타겟)를 모두 사용하여 ADL을 통해 훈련하는 통합 훈련 체계를 구현한다.

실험 결과

연구 질문

  • RQ1적응 증류가 쉽게 학습되는 샘플이 손실을 지배하는 단일 단계 검출기에서 지식 증류 성능을 향상시킬 수 있는가?
  • RQ2레이블이 없는 데이터에 대해 교사의 소프트 레이블을 사용하면, 학생과 교사가 동일하거나 데이터 분포가 다를 경우에도 학생 성능 향상이 가능한가?
  • RQ3예측 불확실성과 예측 갭을 기반으로 적응적인 손실 가중치를 적용해 학습이 어려운 샘플과 모방이 어려운 샘플에 집중함으로써, 기존 증류 방식보다 일반화 성능이 향상되는가?
  • RQ4레이블이 있는 데이터와 레이블이 없는 데이터를 조합해 훈련할 때, 학생 모델이 교사 모델보다 정확도에서 뛰어날 수 있는가?
  • RQ5레이블이 있는 데이터와 레이블이 없는 데이터가 서로 다른 분포를 가질 경우, 제안된 레이블이 없는 데이터 선택 방법의 효과는 어떠한가?

주요 결과

  • SAD를 사용해 훈련한 ResNet-50 학생 검출기는 COCO에서 90ms 추론 시간에 36.9 mAP를 달성하며, ResNet-101 교사 모델을 능가한다. 이는 RetinaNet-50-800보다 더 정확하고 빠르다.
  • ResNext-101 교사 모델에 의해 안내된 학생 모델은 36.6 mAP를 기록하며, 계산 복잡도가 절반인 점을 감안해도 교사 모델을 능가한다.
  • 학생과 교사 모델이 동일한 경우에도 ADL은 어려운 샘플에 집중함으로써 성능 향상을 보여주며, 모델 용량의 차이를 넘어서 효과적인 것을 입증한다.
  • 레이블이 없는 데이터가 COCO와 다른 분포를 가진 ImageNet에서 유래한 준지도 학습 설정에서도 성능 향상이 유지되며, 특히 교사가 객체를 검출하는 양성 반응 이미지를 선별할 경우 성능 향상이 두드러진다.
  • 양성 반응 이미지 비율 ρ ≤ 0.2일 경우, 즉 현실 세계의 데이터 부족 상황에서도 제안된 레이블이 없는 데이터 선택 방법이 증류 성능 향상에 기여한다.
  • SAD를 통해 학생 검출기는 뿌리 90ms 추론 시간에 36.9 mAP를 달성하며, 정확도와 속도 모두 FPN-FRCN과 RetinaNet-101-800를 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.