Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-supervised 3D Object Detection with Proficient Teachers

Junbo Yin, Fang Jin|arXiv (Cornell University)|2022. 07. 26.
Advanced Neural Network Applications인용 수 9
한 줄 요약

이 논문은 ONCE에서 베이스라인 대비 9.51 mAP 향상을 달성하고, Waymo에서 전체 애너테이션을 가진 오라클 모델을 라벨 데이터의 절반만 사용하여 뛰어넘는, 반감독 3D 객체 검출 프레임워크인 ProficientTeachers를 제안한다. 이는 임계값 조정이 필요 없는 고정확도의 편향 없는 가짜 라벨 생성을 통해 고신뢰도의 학습을 가능하게 한다.

ABSTRACT

Dominated point cloud-based 3D object detectors in autonomous driving scenarios rely heavily on the huge amount of accurately labeled samples, however, 3D annotation in the point cloud is extremely tedious, expensive and time-consuming. To reduce the dependence on large supervision, semi-supervised learning (SSL) based approaches have been proposed. The Pseudo-Labeling methodology is commonly used for SSL frameworks, however, the low-quality predictions from the teacher model have seriously limited its performance. In this work, we propose a new Pseudo-Labeling framework for semi-supervised 3D object detection, by enhancing the teacher model to a proficient one with several necessary designs. First, to improve the recall of pseudo labels, a Spatialtemporal Ensemble (STE) module is proposed to generate sufficient seed boxes. Second, to improve the precision of recalled boxes, a Clusteringbased Box Voting (CBV) module is designed to get aggregated votes from the clustered seed boxes. This also eliminates the necessity of sophisticated thresholds to select pseudo labels. Furthermore, to reduce the negative influence of wrongly pseudo-labeled samples during the training, a soft supervision signal is proposed by considering Box-wise Contrastive Learning (BCL). The effectiveness of our model is verified on both ONCE and Waymo datasets. For example, on ONCE, our approach significantly improves the baseline by 9.51 mAP. Moreover, with half annotations, our model outperforms the oracle model with full annotations on Waymo.

연구 동기 및 목표

  • 자율주행에서 비용이 많이 드는 3D 포인트 클라우드 애너테이션에 대한 의존도를 줄이기 위해 반감독 학습을 활용한다.
  • 약한 테이처 모델에서 유도된 가짜 라벨의 높은 거짓 음성 및 거짓 양성 비율 문제를 해결한다.
  • 가짜 라벨 필터링에 대한 수동 임계값 선택이 필요 없도록, 적응형이고 학습 기반의 집계 방식을 도입한다.
  • 박스별 대비 학습을 통한 소프트 감독 신호를 활용하여 학생 모델의 일반화 능력을 향상시킨다.

제안 방법

  • 다양한 증강된 시각(공간적 및 시간적)의 예측을 조합하는 공간-시간 통합(STE) 모듈을 도입하여 고재현율의 시드 박스를 생성한다.
  • 시드 박스를 클러스터링하고 투표를 집계하여 보완하는 클러스터링 기반 박스 투표(CBV) 모듈을 활용하여, 임계값 없이도 정밀도를 향상시킨다.
  • 노이즈가 많은 가짜 라벨이 학생 학습에 악영향을 주는 것을 줄이기 위해 박스별 대비 학습(BCL)을 사용하여 소프트 감독 신호를 생성한다.
  • STE와 CBV를 통합하여 '숙련된 테이처' 모델로 발전시켜 고품질의 가짜 라벨 생성을 가능하게 한다.
  • 정련된 가짜 라벨을 기반으로 테이처 및 학생 네트워크 간 일致성 정규화를 적용하여 특징 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1공간-시간 통합이 가짜 라벨링에서 거짓 양성 비율을 증가시키지 않고도 재현율을 향상시킬 수 있는가?
  • RQ2클러스터링 기반 박스 투표가 가짜 라벨 선택에서 수동 임계값 조정이 필요 없이 효과적으로 라벨을 정밀하게 개선할 수 있는가?
  • RQ3박스별 대비 학습이 노이즈가 많은 가짜 라벨의 영향을 완화하여 학생 모델의 일반화 능력을 향상시키는가?
  • RQ4이러한 구성 요소들을 통합한 숙련된 테이처 모델이 라벨 데이터의 절반만으로도 완전히 감독된 베이스라인을 초월할 수 있는가?

주요 결과

  • ONCE 데이터셋에서 ProficientTeachers는 베이스라인 대비 9.51 mAP 향상을 달성하여, 제한된 감독 환경에서도 뛰어난 성능 향상을 입증한다.
  • 라벨 데이터의 절반만 사용하여 ProficientTeachers는 Waymo 데이터셋에서 전체 애너테이션을 가진 오라클 모델을 초월하며, 데이터 효율성의 우수성을 입증한다.
  • 제거 분석 결과, 전체 모델(STM, CBV, BCL 모듈 포함)은 57.72% mAP를 달성하여 베이스라인 대비 1.97포인트 향상되었다.
  • CBV 모듈만으로도 베이스라인 대비 mAP가 1.42포인트 향상되어, 임계값 조정 없이도 정밀도 향상에 효과적임을 입증한다.
  • BCL 모듈만으로도 mAP에 0.79포인트 기여하여, 학습 안정성 향상과 일반화 능력 향상에 기여함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.