[논문 리뷰] End-to-End Semi-Supervised Object Detection with Soft Teacher
이 논문은 소프트 티처와 박스 조작을 통해 가짜 레이블 품질과 검출 성능을 향상시키기 위해 엔드 투 엔드의 반감독 객체 검출 프레임워크를 제안한다. 지수 이동 평균을 통해 학생 검출기와 티처 모델을 함께 훈련시키고, 분류 손실을 티처의 신뢰도 점수로 가중함으로써, COCO에서 최신 기준 성능을 달성한다. 123K개의 미라벨링된 이미지를 사용하여 mAP 40.9인 검출기를 44.5 mAP로 향상시키며, Swin Transformer 기반 검출기의 경우 test-dev2017에서 61.3 mAP를 기록한다.
This paper presents an end-to-end semi-supervised object detection approach, in contrast to previous more complex multi-stage methods. The end-to-end training gradually improves pseudo label qualities during the curriculum, and the more and more accurate pseudo labels in turn benefit object detection training. We also propose two simple yet effective techniques within this framework: a soft teacher mechanism where the classification loss of each unlabeled bounding box is weighed by the classification score produced by the teacher network; a box jittering approach to select reliable pseudo boxes for the learning of box regression. On the COCO benchmark, the proposed approach outperforms previous methods by a large margin under various labeling ratios, i.e. 1\%, 5\% and 10\%. Moreover, our approach proves to perform also well when the amount of labeled data is relatively large. For example, it can improve a 40.9 mAP baseline detector trained using the full COCO training set by +3.6 mAP, reaching 44.5 mAP, by leveraging the 123K unlabeled images of COCO. On the state-of-the-art Swin Transformer based object detector (58.9 mAP on test-dev), it can still significantly improve the detection accuracy by +1.5 mAP, reaching 60.4 mAP, and improve the instance segmentation accuracy by +1.2 mAP, reaching 52.4 mAP. Further incorporating with the Object365 pre-trained model, the detection accuracy reaches 61.3 mAP and the instance segmentation accuracy reaches 53.0 mAP, pushing the new state-of-the-art.
연구 동기 및 목표
- 정확하지 않은 초기 가짜 레이블에 의존하는 다단계 반감독 객체 검출 방법의 한계를 해결하기 위해.
- 검출과 가짜 레이블링 간 상호 보완적 개선을 통해 훈련 중 가짜 레이블 품질을 향상시키기 위해.
- 복잡한 훈련 파이프라인을 피하기 위해 단순하면서도 효과적인 엔드 투 엔드 프레임워크를 개발하기 위해.
- 신뢰도 가중 감독과 강력한 박스 선택을 통해 미라벨링된 데이터를 더 효과적으로 활용하기 위해.
- 낮은 라벨링 비율과 높은 라벨링 비율 모두에서 최신 기준 성능을 달성하며, 전체 COCO 훈련 세트를 포함한 상황에서도 성능을 높이기 위해.
제안 방법
- 프레임워크는 라벨링된 데이터에 대한 검출 훈련을 위한 학생 모델과, 지수 이동 평균(EMA)을 통해 업데이트되는 티처 모델을 사용하여 미라벨링된 이미지에 대한 온라인 가짜 레이블링을 수행한다.
- 소프트 티처 메커니즘은 각 미라벨링된 박스의 분류 손실을 티처의 신뢰도 점수로 가중함으로써, 더 정보적인 감독을 가능하게 한다.
- 박스 조작은 예측된 박스의 여러 변형된 버전을 통해 회귀 분산을 추정하고, 신뢰할 수 있는 회귀 타겟 선택을 향상시킨다.
- 가짜 레이블은 정밀도를 확보하기 위해 높은 전경 임계값(0.9)을 사용해 필터링되며, 배경 박스는 티처의 신뢰도로 가중되어 잘못된 음성 예측를 줄인다.
- 최종 손실은 라벨링된 데이터에 대한 감독 검출 손실과 가짜 레이블이 부여된 미라벨링된 데이터에 대한 비감독 검출 손실을 조합한다.
- 엔드 투 엔드 훈련은 개선된 검출이 더 나은 가짜 레이블을 만들어내고, 그 가짜 레이블이 다시 검출 성능을 향상시키는 '플라이휠 효과'를 가능하게 한다.
![Figure 1: The proposed end-to-end pseudo-label based semi-supervised object detection method outperforms the STAC [ 27 ] by a large margin on MS-COCO benchmark.](https://ar5iv.labs.arxiv.org/html/2106.09018/assets/x1.png)
실험 결과
연구 질문
- RQ1엔드 투 엔드 훈련 프레임워크가 다단계 접근 방식보다 반감독 객체 검출에서 더 우수한 성능을 낼 수 있는가?
- RQ2신뢰도 점수에 기반한 소프트 티처 감독이 가짜 레이블 품질과 검출 정확도를 어떻게 향상시키는가?
- RQ3박스 조작이 반감독 객체 검출에서 안정적인 회귀 타겟 선택에 어떤 영향을 미치는가?
- RQ4대규모 미라벨링된 데이터를 활용함으로써, 전체 라벨링 데이터를 사용하는 상황에서도 성능을 크게 향상시킬 수 있는가?
- RQ5최신 기준 Swin Transformer 모델을 포함한 다양한 검출기 아키텍처에서 이 프레임워크는 어떻게 성능을 발휘하는가?
주요 결과
- 123K개의 미라벨링된 이미지를 활용하여 전체 COCO 훈련 세트로 훈련된 mAP 40.9인 검출기를 44.5 mAP로 향상시켜 +3.6 mAP 향상 달성.
- 최신 기준 HTC++(Swin-L) 검출기의 경우, test-dev2017에서 mAP를 58.9에서 60.4로 향상시켜 처음으로 60 mAP를 돌파.
- Object365 사전 훈련을 활용한 결과, 검출에서는 61.3 mAP, 인스턴스 세그멘테이션에서는 53.0 mAP를 기록하여 COCO에서 새로운 최신 기준 성능 달성.
- 제거 분석 결과, 소프트 티처와 박스 조작을 함께 사용할 경우 EMA 전용 기준보다 mAP가 3.0 포인트 향상되며, 소프트 티처만으로도 2.4 포인트 향상 기여.
- 가짜 레이블 필터링에 최적의 전경 임계값은 0.9이며, 최적의 박스 조작 횟수는 10회로, N=10에서 성능이 포화 상태에 도달함.
- 이전 최신 기준 방법인 STAC 및 자체 훈련보다도 훨씬 적은 미라벨링된 데이터(123K vs. 290만 장)를 사용함에도 불구하고 성능를 뛰어넘음.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.