Skip to main content
QUICK REVIEW

[논문 리뷰] DTG-SSOD: Dense Teacher Guidance for Semi-Supervised Object Detection

Gang Li, Xiang Li|arXiv (Cornell University)|2022. 07. 12.
Video Surveillance and Tracking Methods인용 수 13
한 줄 요약

이 논문은 기존의 '희소에서 밀도로'의 패러다임을 '밀도에서 밀도로'의 접근으로 대체함으로써 교사의 밀도 있는 예측을 직접 활용하는 새로운 준지도 학습 객체 검출 프레임워크인 DTG-SSOD를 제안한다. Inverse NMS 클러스터링과 랭킹 매칭을 도입하여 학생의 예측을 교사의 NMS 그룹화 및 점수 순위와 정렬함으로써 COCO에서 10% 레이블 비율일 때 35.9 mAP의 최신 기준 성능을 달성하며, 이는 이전 방법보다 1.9 mAP 높은 성능이다.

ABSTRACT

The Mean-Teacher (MT) scheme is widely adopted in semi-supervised object detection (SSOD). In MT, the sparse pseudo labels, offered by the final predictions of the teacher (e.g., after Non Maximum Suppression (NMS) post-processing), are adopted for the dense supervision for the student via hand-crafted label assignment. However, the sparse-to-dense paradigm complicates the pipeline of SSOD, and simultaneously neglects the powerful direct, dense teacher supervision. In this paper, we attempt to directly leverage the dense guidance of teacher to supervise student training, i.e., the dense-to-dense paradigm. Specifically, we propose the Inverse NMS Clustering (INC) and Rank Matching (RM) to instantiate the dense supervision, without the widely used, conventional sparse pseudo labels. INC leads the student to group candidate boxes into clusters in NMS as the teacher does, which is implemented by learning grouping information revealed in NMS procedure of the teacher. After obtaining the same grouping scheme as the teacher via INC, the student further imitates the rank distribution of the teacher over clustered candidates through Rank Matching. With the proposed INC and RM, we integrate Dense Teacher Guidance into Semi-Supervised Object Detection (termed DTG-SSOD), successfully abandoning sparse pseudo labels and enabling more informative learning on unlabeled data. On COCO benchmark, our DTG-SSOD achieves state-of-the-art performance under various labelling ratios. For example, under 10% labelling ratio, DTG-SSOD improves the supervised baseline from 26.9 to 35.9 mAP, outperforming the previous best method Soft Teacher by 1.9 points.

연구 동기 및 목표

  • 기존 '희소에서 밀도로'의 패러다임이 수작업으로 설계된 NMS와 레이블 할당 과정에서 누적되는 노이즈 문제를 해결하기 위해.
  • 교사 모델의 밀도 있는 예측을 후처리된 희소한 가짜 레이블이 아닌 그대로 활용하여 학생 모델에 더 정보가 풍부하고 직접적인 지도를 제공하기 위해.
  • 교사가 학습한 문맥적 관계와 순위 관계를 유지함으로써, 비라벨 데이터에 대한 일반화 능력과 성능을 향상시키기 위해.
  • Soft Teacher와 Mean-Teacher와 같은 기존 방법들보다 더 높은 정확도와 학습 효율성을 달성하기 위해.

제안 방법

  • 교사의 밀도 있는 예측을 직접 지도로 사용함으로써 NMS와 희소한 가짜 레이블을 생략하는 '밀도에서 밀도로'의 패러다임을 제안한다.
  • 교사의 NMS 과정에서 유도된 클러스터링 구조를 학습함으로써, 학생의 후보군 그룹화를 교사의 NMS 그룹화와 일치시키기 위해 Inverse NMS 클러스터링(INC)을 도입한다.
  • 클러스터링된 후보군에 대한 교사의 점수 순위 지식을 학생 모델로 전달하기 위해 랭킹 매칭(RM)을 활용하여 상대적 신뢰도 순서를 유지한다.
  • 교사 모델을 학생 모델의 지속적인 평균 이동 평균(EMA)을 통해 업데이트하여 강력하고 일관된 교사 모델을 유지한다.
  • INC와 RM에서 유도된 밀도 있는 지도를 학생 모델의 분류 및 회귀 헤드 양쪽에 적용한다.
  • 기존의 레이블 할당 방식을 교사의 NMS 출력에서 유도된 그룹 기반 레이블 할당으로 대체함으로써 노이즈를 감소시키고 레이블 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1교사의 전체 예측 세트에서 직접적인 밀도 있는 지도를 제공함으로써, 기존의 표준 '희소에서 밀도로' 파이프라인을 넘어서 준지도 학습 객체 검출 성능을 향상시킬 수 있는가?
  • RQ2학생 모델이 교사의 NMS 행동, 즉 후보군의 클러스터링과 순위 매칭을 효과적으로 재현할 수 있는가?
  • RQ3NMS와 레이블 할당과 같은 중간 단계를 제거함으로써 비라벨 데이터에서의 노이즈 감소와 성능 향상이 이루어지는가?
  • RQ4제안된 방법이 Soft Teacher와 Mean-Teacher와 같은 기존 최신 기준 방법들보다 더 높은 정확도와 학습 효율성을 달성할 수 있는가?

주요 결과

  • 10% 레이블 비율에서 DTG-SSOD는 COCO에서 35.9 mAP를 달성하였으며, 지도 학습 기준선(26.9 mAP)과 이전 최신 기준 방법인 Soft Teacher보다 1.9 mAP 높은 성능을 보였다.
  • 1% 레이블 비율에서도 DTG-SSOD는 27.4 mAP를 기록하여 극도로 제한된 레이블 데이터 조건에서도 뛰어난 강건성을 보였다.
  • 180,000회의 학습 반복 중 절반에 해당하는 90,000회 반복만으로도 10% 레이블 비율에서 33.7 mAP를 달성하여 높은 학습 효율성을 입증했다.
  • 완전 레이블 설정(100% 레이블)에서 DTG-SSOD는 Soft Teacher의 반만 되는 학습 반복 수로도 44.7 mAP를 달성하였고, Soft Teacher의 44.5 mAP와 비교해도 뛰어난 효율성과 성능을 보였다.
  • 제거 분석 결과, INC에서 최종 NMS에 남은 박스만을 회귀 타겟으로 사용할 경우(35.1 mAP) 전체 교사 박스를 사용하는 것(34.3 mAP)보다 더 높은 성능을 기록함을 확인했다.
  • 정성적 분석 결과, DTG-SSOD는 교사의 신뢰도와 순위 정보를 활용하여 저품질 및 모호한 후보군을 더 효과적으로 억제함으로써 오해의 소지가 있는 양성 할당을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.