Skip to main content
QUICK REVIEW

[논문 리뷰] 3DIoUMatch: Leveraging IoU Prediction for Semi-Supervised 3D Object Detection

He Wang, Yezhen Cong|arXiv (Cornell University)|2020. 12. 08.
Advanced Neural Network Applications참고 문헌 33인용 수 10
한 줄 요약

3DIoUMatch는 예측된 3D IoU를 국소화 신뢰도 지표로 활용하고, 카테고리 인식형 자가 조정 필터링 메커니즘을 결합함으로써 허위 레이블 품질을 향상시키는 새로운 반감독 3D 객체 검출 방법을 제안한다. 이는 10%의 레이블 데이터로 ScanNet과 SUN-RGBD에서 최신 기준 성능을 달성하며, 이전 방법 대비 mAP@0.25에서 7.7% 향상되고 mAP@0.5에서 8.5% 향상된다. 또한 KITTI에서 반감독 3D 검출을 처음으로 구현하여, 완전 감독 기반 보다 최대 7.6% 높은 성능을 기록한다.

ABSTRACT

3D object detection is an important yet demanding task that heavily relies on difficult to obtain 3D annotations. To reduce the required amount of supervision, we propose 3DIoUMatch, a novel semi-supervised method for 3D object detection applicable to both indoor and outdoor scenes. We leverage a teacher-student mutual learning framework to propagate information from the labeled to the unlabeled train set in the form of pseudo-labels. However, due to the high task complexity, we observe that the pseudo-labels suffer from significant noise and are thus not directly usable. To that end, we introduce a confidence-based filtering mechanism, inspired by FixMatch. We set confidence thresholds based upon the predicted objectness and class probability to filter low-quality pseudo-labels. While effective, we observe that these two measures do not sufficiently capture localization quality. We therefore propose to use the estimated 3D IoU as a localization metric and set category-aware self-adjusted thresholds to filter poorly localized proposals. We adopt VoteNet as our backbone detector on indoor datasets while we use PV-RCNN on the autonomous driving dataset, KITTI. Our method consistently improves state-of-the-art methods on both ScanNet and SUN-RGBD benchmarks by significant margins under all label ratios (including fully labeled setting). For example, when training using only 10\% labeled data on ScanNet, 3DIoUMatch achieves 7.7% absolute improvement on mAP@0.25 and 8.5% absolute improvement on mAP@0.5 upon the prior art. On KITTI, we are the first to demonstrate semi-supervised 3D object detection and our method surpasses a fully supervised baseline from 1.8% to 7.6% under different label ratios and categories.

연구 동기 및 목표

  • 3D 객체 검출에서 비용이 많이 드는 3D 애너테이션에 대한 의존도를 줄이기 위해 효과적인 반감독 학습을 가능하게 하기 위해.
  • 복잡한 3D 검출 작업에서 티처-스터디 프레임워크에 의해 생성된 허위 레이블의 높은 노이즈 문제를 해결하기 위해.
  • 클래스 및 오브제кт네스 스코어를 초월하여 국소화 정확도 지표로 3D IoU 추정을 활용하여 허위 레이블 품질을 향상시키기 위해.
  • 고품질 레이블 커버리지와 강건성을 균형 잡는 동적이고 카테고리 인식형 필터링 메커니즘 설계하기 위해.
  • 자율 주행 데이터셋인 KITTI에서 반감독 3D 검출 프레임워크를 처음으로 구현하여, 완전 감독 기반 보다 뛰어난 성능을 달성하기 위해.

제안 방법

  • 학생 네트워크를 사용하여 비라벨 데이터로부터 허위 레이블을 생성하기 위해 티처-스터디 상호 학습 프레임워크를 채택한다.
  • 예측된 클래스 확률과 오브제кт네스 스코어를 기반으로 한 신뢰도 기반 필터링 메커니즘을 도입하여 저품질 허위 레이블을 제거한다.
  • 국소화 정확도 지표로 사용할 수 있는 새로운 3D IoU 추정 모듈을 제안하여 잘못 국소화된 제안 영역의 필터링을 향상시킨다.
  • 이중 단계 필터링 프로세스를 구현한다: 첫 번째로 낮은 IoU 임계치를 사용해 약한 제안 영역을 필터링하고, 두 번째로 IoU 유도 Lower-Half Suppression (LHS)를 적용하여 높은 겹침률을 보이지만 낮은 IoU를 가진 박스의 절반만 제거한다.
  • 학습 시 허위 레이블 필터링과 테스트 시 Non-Maximal Suppression (NMS)에 모두 추정된 IoU를 활용하여 검출 정확도를 향상시킨다.
  • 실내 데이터셋(ScanNet, SUN-RGB-D)에는 VoteNet을, KITTI에는 PV-RCNN을 사용하여 방법을 구현하고, IoU 모듈을 검출 헤드에 통합한다.
Figure 1: 3DIoUMatch pipeline at semi-supervised training stage. We adopt as our backbone an extended version of VoteNet with an additional 3D IoU estimation module. For SSL, we utilize a teacher-student mutual learning framework, composed of a learnable student taking strongly augmented input data
Figure 1: 3DIoUMatch pipeline at semi-supervised training stage. We adopt as our backbone an extended version of VoteNet with an additional 3D IoU estimation module. For SSL, we utilize a teacher-student mutual learning framework, composed of a learnable student taking strongly augmented input data

실험 결과

연구 질문

  • RQ1반감독 3D 객체 검출에서 3D IoU 추정이 국소화 신뢰도 지표로 효과적으로 작용하여 허위 레이블 품질을 향상시킬 수 있는가?
  • RQ2노이즈가 많은 허위 레이블 환경에서 고품질 레이블 커버리지와 강건성을 균형 잡는 필터링 메커니즘은 어떻게 설계할 수 있는가?
  • RQ3카테고리 인식형 자가 조정 임계치 전략이 고정 임계치 또는 NMS 기반 필터링보다 반감독 3D 검출에서 더 우수한 성능을 낼 수 있는가?
  • RQ43D IoU 추정을 통합함으로써 실내 및 실외 환경을 포함한 다양한 3D 검출 벤치마크에서 일관된 성능 향상이 이루어지는가?
  • RQ5기존 연구에서 이러한 결과를 도출하지 못한 바 있는 자율 주행 데이터셋인 KITTI에 대해 반감독 3D 객체 검출이 성공적으로 확장될 수 있는가?

주요 결과

  • 10%의 레이블 데이터로 ScanNet에서 3DIoUMatch는 이전 최신 기준 방법인 SESS 대비 mAP@0.25에서 7.7%p 향상되고 mAP@0.5에서 8.5%p 향상된다.
  • 5%의 레이블 데이터로 SUN-RGB-D에서 3DIoUMatch는 SESS 대비 mAP@0.25에서 4.8%p 향상되고 mAP@0.5에서 8.0%p 향상된다.
  • KITTI에서 3DIoUMatch는 반감독 3D 객체 검출을 처음으로 도입하였고, 다양한 레이블 비율과 카테고리에서 완전 감독 기반 보다 1.8%에서 7.6%까지 높은 성능을 기록한다.
  • 제안된 IoU 유도 Lower-Half Suppression (LHS)는 표준 IoU 유도 NMS보다 더 많은 고품질 제안 영역을 유지하면서 노이즈가 많은 영역은 효과적으로 제거한다.
  • 비라벨 데이터에서 투표 예측이나 오브제кт네스를 허위 레이블로 감독할 경우 성능이 악화되며, 이는 신뢰할 수 있는 필터링 없이 이러한 감독 방식이 신뢰할 수 없다는 것을 시사한다.
  • 절단 분석 결과, IoU 추정을 통합한 3DIoUMatch 방법이 검출 정확도를 크게 향상시키고 임의의 오진을 감소시킴을 확인하였으며, 이는 ScanNet과 SUN-RGB-D에서의 정성적 결과로도 확인된다.
Figure 2: 3DIoUMatch results with different IoU thresholds on ScanNet 10%.
Figure 2: 3DIoUMatch results with different IoU thresholds on ScanNet 10%.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.