Skip to main content
QUICK REVIEW

[논문 리뷰] PV-RCNN: Point-Voxel Feature Set Abstraction for 3D Object Detection

Shaoshuai Shi, Chaoxu Guo|arXiv (Cornell University)|2019. 12. 31.
3D Shape Modeling and Analysis참고 문헌 46인용 수 184
한 줄 요약

PV-RCNN은 LiDAR 포인트 클라우드에서 보셀 기반 특징과 PointNet 기반 특징을 결합하여 3D 물체 탐지에서 최첨단 성능을 달성하고, 고품질 제안과 RoI 특징을 정밀하게 생성합니다.

ABSTRACT

We present a novel and high-performance 3D object detection framework, named PointVoxel-RCNN (PV-RCNN), for accurate 3D object detection from point clouds. Our proposed method deeply integrates both 3D voxel Convolutional Neural Network (CNN) and PointNet-based set abstraction to learn more discriminative point cloud features. It takes advantages of efficient learning and high-quality proposals of the 3D voxel CNN and the flexible receptive fields of the PointNet-based networks. Specifically, the proposed framework summarizes the 3D scene with a 3D voxel CNN into a small set of keypoints via a novel voxel set abstraction module to save follow-up computations and also to encode representative scene features. Given the high-quality 3D proposals generated by the voxel CNN, the RoI-grid pooling is proposed to abstract proposal-specific features from the keypoints to the RoI-grid points via keypoint set abstraction with multiple receptive fields. Compared with conventional pooling operations, the RoI-grid feature points encode much richer context information for accurately estimating object confidences and locations. Extensive experiments on both the KITTI dataset and the Waymo Open dataset show that our proposed PV-RCNN surpasses state-of-the-art 3D detection methods with remarkable margins by using only point clouds. Code is available at https://github.com/open-mmlab/OpenPCDet.

연구 동기 및 목표

  • 희박하고 불규칙한 LiDAR 포인트 클라우드에서 고정밀도 3D 물체 탐지의 필요성을 제시한다.
  • 3D 보셀 CNN과 PointNet 스타일의 세트 추상화를 결합한 통합 프레임워크를 제안한다.
  • 효율적이고 풍부한 표현을 위해 보셀-에서 키포인트로의 장면 인코딩과 키포인트-에서 그리드 RoI 특징 추상화를 개발한다.
  • 다중 스케일 컨텍스트 집합화를 통해 제안의 정밀한 개선과 신뢰도 추정을 가능하게 한다.
  • 포인트 클라우드만을 사용하여 KITTI와 Waymo Open 데이터셋에서 최첨단 성능을 입증한다.

제안 방법

  • 효율적인 특징 인코딩 및 3D 제안 생성을 위한 백본으로 희소 컨볼루션을 갖춘 3D 보셀 CNN을 사용한다.
  • Voxel set abstraction (VSA)를 통해 전체 장면의 보셀 CNN 특징을 소수의 키포인트로 요약한다.
  • 다중 반경 이웃 집합과 PointNet 스타일 풀링을 사용하여 각 키포인트에 다중 스케일 보셀 특징을 집계한다.
  • 원시 포인트와 BEV(조감도) 특징으로 키포인트 특징을 풍부하게 하고 필요 시 Predicted Keypoint Weighting (PKW)를 적용하여 전경 강조를 수행한다.
  • RoI-grid 풀링을 수행한다: 각 3D 제안에 대해 6x6x6 격자를 샘플링하고 다중 반경 이웃 집합을 이용한 세트 추상을 사용해 키포인트 특징을 RoI-grid 특징으로 융합한다.
  • 다음 손실 값으로 엔드-투-엔드 학습한다: L_rpn(제안 생성), L_seg(키포인트 분할), L_rcnn(제안 정교화 및 IoU-가이드 신뢰도 포함).

실험 결과

연구 질문

  • RQ1하이브리드 포인트-보셀 아키텍처가 LiDAR-only 3D 탐지에서 순수 보셀 또는 순수 포인트 기반 탐지기를 능가할 수 있는가?
  • RQ2보셀 CNN 특징을 소수의 키포인트로 요약하는 것이 RoI 정교화를 위한 효율적이면서도 풍부한 특징 집합화를 가능하게 하는가?
  • RQ3다중 스케일, 반경 기반 세트 추상이 전통적인 RoI 풀링과 비교해 제안 정교화 및 신뢰도 추정에 도움을 주는가?
  • RQ4원시 포인트와 BEV 특징으로 키포인트를 풍부하게 하고 가중된 키포인트(PKW)가 탐지 성능에 미치는 영향은 무엇인가?
  • RQ5PV-RCNN이 대규모 데이터셋(KITTI, Waymo Open)에서 이전의 최첨단과 비교해 어떤 성능을 보이는가?

주요 결과

  • PV-RCNN은 KITTI 자동차 3D 탐지에서 최첨단 성능을 달성하여 보고된 시점에 LiDAR-전용 방법 중 1위를 차지했다.
  • KITTI에서 PV-RCNN은 Easy/Moderate/Hard 자동차 탐지에 대해 이전 방법들보다 3D mAP를 각각 1.58/1.72/1.73 포인트 개선한다.
  • PV-RCNN은 Easy 및 Moderate 자동차 탐지에서 BEV mAP를 최상위로 달성하며 Hard에서 다소 하락하고, Moderate/Hard에서 사이클리스트 탐지에서도 이전의 LiDAR-전용 방법을 능가한다.
  • 표 1은 PV-RCNN이 차에 대해 3D mAP를 90.25 (Easy), 81.43 (Moderate), 76.82 (Hard)로 달성하고 BEV mAP를 94.98 (Easy), 90.65 (Moderate), 86.14 (Hard)로 달성하며 사이클리스트 지표는 78.60 (Easy), 63.71 (Moderate), 57.65 (Hard) 3D mAP, BEV은 82.49 (Easy), 68.89 (Moderate), 62.41 (Hard)이다.
  • PV-RCNN은 KITTI val split (R11 및 R40)에서 이전 방법들을 능가하고 Waymo Open Test/Validation 세트에서도 강력한 성능을 보여준다(세부 내용은 본 논문에 있음).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.