Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly Supervised 3D Object Detection from Lidar Point Cloud

Qinghao Meng, Wenguan Wang|Lirias (KU Leuven)|2020. 07. 23.
Remote Sensing and LiDAR Applications참고 문헌 2인용 수 13
한 줄 요약

이 논문은 오직 500개의 약한 레이블이 부여된 베이비의 시점(BEV) 영상과 534개의 정확한 3D 인스턴스 레이블만을 사용하여 훈련하는 약한 감독 기반 3D 객체 검출 프레임워크를 제안한다. 두 단계 아키텍처를 사용하여 먼저 BEV 중심에서 실린더형 제안을 생성하고, 그 다음에 이를 3D 상자로 정밀화함으로써, 완전 감독 기반 검출기의 성능의 85–95%를 달성하면서도 레이블링 비용을 크게 줄였다.

ABSTRACT

It is laborious to manually label point cloud data for training high-quality 3D object detectors. This work proposes a weakly supervised approach for 3D object detection, only requiring a small set of weakly annotated scenes, associated with a few precisely labeled object instances. This is achieved by a two-stage architecture design. Stage-1 learns to generate cylindrical object proposals under weak supervision, i.e., only the horizontal centers of objects are click-annotated on bird's view scenes. Stage-2 learns to refine the cylindrical proposals to get cuboids and confidence scores, using a few well-labeled object instances. Using only 500 weakly annotated scenes and 534 precisely labeled vehicle instances, our method achieves 85-95% the performance of current top-leading, fully supervised detectors (which require 3, 712 exhaustively and precisely annotated scenes with 15, 654 instances). More importantly, with our elaborately designed network architecture, our trained model can be applied as a 3D object annotator, allowing both automatic and active working modes. The annotations generated by our model can be used to train 3D object detectors with over 94% of their original performance (under manually labeled data). Our experiments also show our model's potential in boosting performance given more training data. Above designs make our approach highly practical and introduce new opportunities for learning 3D object detection with reduced annotation burden.

연구 동기 및 목표

  • 완전히 레이블링된 포인트 클라우드에 의존하는 3D 객체 검출의 높은 레이블링 비용을 줄이기 위해.
  • 대규모 정확한 3D 데이터를 확보하는 데 소요되는 시간과 비용 문제를 해결하기 위해.
  • 희박하고 쉽게 확보할 수 있는 레이블을 활용한 약한 감독을 통해 실용적인 3D 검출기 구현을 가능하게 하기 위해.
  • 레이블링 부담을 추가로 줄이기 위해 활성 또는 자동 3D 레이블링 도구로 기능할 수 있는 모델을 개발하기 위해.

제안 방법

  • 1단계는 BEV 특징 맵에서 객체 중심 히트맵과 전경 포인트 마스크를 예측하기 위한 이중 브랜치 네트워크를 사용하며, 약한 감독 설정에서 오직 클릭 레이블된 객체 중심만을 사용해 훈련된다.
  • 예측된 중심 주변에 고정된 반경(보행자: 1m, 차량: 4m)을 가진 실린더형 제안을 생성하며, 높이 정보가 누락된 것을 보완하기 위해 y축으로 무한하게 연장된다.
  • 2단계는 소수의 정확한 3D 인스턴스 레이블을 사용하여 실린더형 제안을 3D 경계 상자와 신뢰도 점수로 정밀화한다. 이 과정은 불완전한 감독을 적용한다.
  • 네트워크에서는 두 단계 훈련 프로토콜을 사용한다: 먼저 약한 레이블이 부여된 BEV 데이터에서 사전 훈련하고, 그 다음 소수의 정확한 레이블이 부여된 인스턴스에서 미세 조정한다.
  • 모델은 자동 및 활성(사람이 참여하는) 레이블링 모드를 모두 지원하며, 사람의 클릭을 통해 제안 생성을 정밀화할 수 있다.
  • 반경 기반 필터링 전략을 사용하여 훈련 샘플을 선택한다: 진짜 중심으로부터 0.5m 이내의 제안은 감독에 사용된다.

실험 결과

연구 질문

  • RQ1BEV 맵에서 오직 클릭 레이블된 중심과 소수의 정확한 3D 인스턴스 레이블만을 사용하여 3D 객체 검출을 효과적으로 훈련시킬 수 있는가?
  • RQ2희박하고 정확도가 떨어지는 레이블에서 유도된 약한 감독이 완전 감독 기반 검출기의 성능을 어느 정도 충족시킬 수 있는가?
  • RQ3훈련된 검출기를 실질적으로 레이블링 비용을 줄이기 위해 효율적인 3D 레이블링 도구로 재사용할 수 있는가?
  • RQ4실세계 영상에서의 가림, 희박한 포인트 클라우드, 배경 잡음에 대해 이 방법은 얼마나 강건한가?

주요 결과

  • 제안된 방법은 오직 500개의 약한 레이블이 부여된 영상과 534개의 정확한 레이블이 부여된 인스턴스만을 사용함에도 불구하고, 최신 완전 감독 기반 검출기 성능의 85–95%를 달성한다.
  • 동일한 훈련 데이터를 사용할 경우, 모델의 예측 결과를 활용해 정확한 3D 인스턴스 레이블이 부여된 데이터로 훈련된 검출기의 성능의 94% 이상을 달성하는 3D 검출기를 훈련시킬 수 있다.
  • 모델은 매우 가림이 심한 차량이나 혼잡한 보행자 영상과 같은 어려운 케이스에도 잘 일반화되어 많은 경우 정확한 3D 경계 상자를 생성한다.
  • 활성 레이블링 모드를 통해 사람의 참여를 통해 예측을 보완할 수 있으며, 누락되거나 잘못된 검출을 보완하기 위해 추가 클릭 레이블을 제공함으로써 성능을 향상시킬 수 있다.
  • 실패 케이스의 주요 원인은 심한 가림, 차량과 유사한 배경 객체, 그리고 매우 희박한 전경 포인트이며, 이는 다중 모odal 입력을 통한 향상 가능성을 시사한다.
  • 완전한 3D 상자 레이블링 대비 중심 클릭만을 사용함으로써 약 40–50배의 레이블링 시간 절감이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.