Skip to main content
QUICK REVIEW

[논문 리뷰] From Voxel to Point: IoU-guided 3D Object Detection for Point Cloud with Voxel-to-Point Decoder

Jiale Li, Hang Dai|arXiv (Cornell University)|2021. 08. 08.
Advanced Neural Network Applications참고 문헌 51인용 수 6
한 줄 요약

이 논문은 원시 포인트 클라우드에서 세밀한 포인트 특징을 추출하기 위해 잔차 벡셀-포인트 디코더를 도입하여 벡셀 기반 검출 성능을 향상시키는 IoU 유도 이단계 3D 객체 검출기를 제안한다. 예측된 IoU를 정밀하게 조정된 박스에 맞추고 RoI 정렬 특징과 코너 기하학 임베딩을 융합함으로써, KITTI 및 Waymo Open Dataset에서 최신 기술 수준의 성능을 달성하며 mAP 향상이 뚜렷하다.

ABSTRACT

In this paper, we present an Intersection-over-Union (IoU) guided two-stage 3D object detector with a voxel-to-point decoder. To preserve the necessary information from all raw points and maintain the high box recall in voxel based Region Proposal Network (RPN), we propose a residual voxel-to-point decoder to extract the point features in addition to the map-view features from the voxel based RPN. We use a 3D Region of Interest (RoI) alignment to crop and align the features with the proposal boxes for accurately perceiving the object position. The RoI-Aligned features are finally aggregated with the corner geometry embeddings that can provide the potentially missing corner information in the box refinement stage. We propose a simple and efficient method to align the estimated IoUs to the refined proposal boxes as a more relevant localization confidence. The comprehensive experiments on KITTI and Waymo Open Dataset demonstrate that our method achieves significant improvements with novel architectures against the existing methods. The code is available on Github URL\footnote{\url{https://github.com/jialeli1/From-Voxel-to-Point}}.

연구 동기 및 목표

  • 벡셀 인코더에서의 다운샘플링으로 인한 포즈 정보의 손실 문제를 해결하기 위해.
  • 초기 제안 박스가 아닌 정밀하게 조정된 제안 박스에 예측된 IoU를 맞추어 이단계 3D 객체 검출의 정렬 정확도를 향상시키기 위해.
  • 코너 기하학 임베딩을 RoI 정렬 특징과 융합하여 실제 코너 포인트가 누락된 경우를 보완함으로써 특징 표현을 향상시키기 위해.
  • RPN 단계에서 높은 박스 재현율을 유지하면서도 원시 포인트 정보를 유지하는 효율적인 잔차 벡셀-포인트 디코더를 개발하기 위해.
  • 복잡한 포인트 클라우드 환경에서 대규모 및 장거리 검출 시나리오에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • K-최근접 이웃 벡셀 주변의 특징을 통합하기 위해 스택된 블록과 스킵 연결을 사용하는 잔차 벡셀-포인트 디코더를 도입한다.
  • 디코더는 계층적이고 잔차적인 방식으로 포인트 특징을 학습하며, 전경 및 배경 감도를 감시하기 위해 세그먼테이션 마스크를 사용한다.
  • 3D 영역(Region of Interest, RoI) 정렬을 적용하여 지도 시각화 및 포인트 특징을 제안 박자에 정렬하여 정밀한 정렬을 달성한다.
  • RoI 정렬 특징에 코너 기하학 임베딩을 추가하여 3D 경계 상자에서 누락된 코너 정보를 복원한다.
  • 병렬된 IoU 추정 브랜치가 RoI 정렬 특징에서 IoU 점수를 회귀하며, 예측된 IoU를 정밀 조정된 박스에 연결하기 위한 신규 보정 방법을 도입하여 NMS 순위를 향상시킨다.
  • 지도 시각화 및 포인트 특징 학습에 공유된 벡셀 인코딩을 사용하여 계산 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1벡셀화 과정에서 손실된 세밀한 포인트 특징을 효과적으로 복원할 수 있는가? 이는 3D 검출 정확도 향상에 기여하는가?
  • RQ2초기 제안 박스가 아닌 정밀 조정된 제안 박자에 예측된 IoU 점수를 맞추는 것이 NMS에서 더 나은 정렬 성능을 이끌어내는가?
  • RQ3코너 기하학 임베딩은 포인트 클라우드에서 실제 코너 포인트가 부재한 경우에 경계 상자 보정에 기여하는가?
  • RQ4제안된 방법은 Waymo Open Dataset와 같은 대규모 및 장거리 3D 검출 벤치마크에서 어떻게 성능을 발휘하는가?
  • RQ5잔차 학습과 계층적 특징 통합이 벡셀-포인트 디코더의 전체 검출 성능에 기여하는 정도는 어떠한가?

주요 결과

  • KITTI 데이터셋에서 사이클리스트 클래스(어려움 낮음)에 대해 81.49% mAP, 보행자 클래스(어려움 낮음)에 대해 51.80% mAP를 기록하여 이전 최신 기술 수준의 방법들을 능가한다.
  • Waymo Open Dataset의 LEVEL_1에서 3D AP 77.24%와 BEV AP 88.93%를 기록하며, PV-RCNN 대비 각각 +6.94 및 +1.82 향상되었다.
  • LEVEL_2에서는 3D AP 69.77%와 BEV AP 82.18%를 기록하여 PV-RCNN 대비 각각 +4.41 및 +4.73 향상되었으며, 희박하고 장거리 검출 상황에서 강력한 성능을 보였다.
  • 제거 분석 결과, 벡셀-포인트 디코더와 IoU 보정 구성 요소가 성능 향상에 각각 기여하며, 특히 장거리 시나리오에서 두드러진다.
  • 모든 어려움 수준과 메트릭에서 일관된 향상이 나타나, 포인트 기반 3D 검출에서 잔차 학습과 특징 융합의 효과를 입증한다.
  • 정성적 결과에서는 향상된 특징 표현과 IoU 유도 보정 덕분에 먼 곳에 있는 또는 희박한 객체에 대해 더 타이트하고 정확한 경계 상자를 생성하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.