Skip to main content
QUICK REVIEW

[논문 리뷰] Pillar R-CNN for Point Cloud 3D Object Detection

Guangsheng Shi, Ruifeng Li|arXiv (Cornell University)|2023. 02. 26.
Advanced Neural Network Applications인용 수 4
한 줄 요약

Pillar R-CNN는 점-바이올 레이어 간 상호작용 대신 기둥 기반 바라보기 위도(BEV) 특징 표현을 활용하는 간단하면서도 효과적인 이단계 3D 객체 검출 프레임워크를 제안한다. FPN을 RPN에 통합하여 다중 척도의 제안을 생성하고, 특징 융합을 위해 조밀한 횡방향 연결을 사용함으로써, 최소한의 계산 부담으로 Waymo Open Dataset에서 최신 기술 수준(SOTA) 성능을 달성한다. 이는 기둥 기반 BEV 특징만으로도 고정밀도 검출을 위한 충분한 3D 구조를 유지할 수 있음을 보여준다.

ABSTRACT

The performance of point cloud 3D object detection hinges on effectively representing raw points, grid-based voxels or pillars. Recent two-stage 3D detectors typically take the point-voxel-based R-CNN paradigm, i.e., the first stage resorts to the 3D voxel-based backbone for 3D proposal generation on bird-eye-view (BEV) representation and the second stage refines them via the intermediate point representation. Their primary mechanisms involve the utilization of intermediary keypoints to restore the substantial 3D structure context from the converted BEV representation. The skilled point-voxel feature interaction, however, makes the entire detection pipeline more complex and compute-intensive. In this paper, we take a different viewpoint -- the pillar-based BEV representation owns sufficient capacity to preserve the 3D structure. In light of the latest advances in BEV-based perception, we devise a conceptually simple yet effective two-stage 3D detection architecture, named Pillar R-CNN. On top of densified BEV feature maps, Pillar R-CNN can easily introduce the feature pyramid architecture to generate 3D proposals at various scales and take the simple 2D R-CNN style detect head for box refinement. Our Pillar R-CNN performs favorably against state-of-the-art 3D detectors on the large-scale Waymo Open Dataset but at a small extra cost. It should be highlighted that further exploration into BEV perception for applications involving autonomous driving is now possible thanks to the effective and elegant Pillar R-CNN architecture.

연구 동기 및 목표

  • 복잡한 점-바이올 특징 상호작용을 제거함으로써 이단계 3D 객체 검출을 단순화하기 위해.
  • 기둥 기반 BEV 표현만으로도 고정밀도 검출을 위한 충분한 3D 구조적 맥락을 유지할 수 있는지 조사하기 위해.
  • 2D 이미지 검출의 진전을 BEV 기반 3D 검출에 적응시켜 2D 이미지 검출과 3D 포인트 클라우드 검출 간 도메인 갭을 메우기 위해.
  • 기존의 점-바이올 기반 이단계 검출기들과 비교해 계산 복잡도를 감소시키면서도 정확도를 유지하거나 향상시키기 위해.

제안 방법

  • 하나의 순방향 전파로 계층적인 BEV 특징 맵을 생성하기 위해 하이브리드 희소 및 조밀한 컨볼루션을 사용하는 기둥 기반 특징 백본을 사용한다.
  • 희소한 기둥 볼륨을 조밀하게 만들기 위해 기둥 기반 특징 피라미드를 구축하기 위해 횡방향 연결 레이어를 도입한다.
  • RPN에서 FPN 스타일의 특징 집약을 적용하여 다중 척도에서 클래스별 3D 제안을 생성함으로써, 작은 객체 검출을 향상시킨다.
  • 상자 보정을 위해 조밀한 2D 풀링 특징 맵을 추출하기 위해 RoIAlign을 적용하며, 단일이고 관리 가능한 해상도(4× 다운샘플링)를 사용한다.
  • 객체 크기 변화에 대한 강건성을 향상시키기 위해 클래스에 관계없고 단일 척도의 풀링 맵을 사용한다.
  • IoU 인식 기반 신뢰도 보정을 적용하여 제안의 순위 매기기와 분류 점수 일치를 향상시킨다.

실험 결과

연구 질문

  • RQ1기둥 기반 BEV 표현만으로도 고정밀도 3D 객체 검출을 위한 충분한 3D 구조적 맥락을 유지할 수 있는가?
  • RQ2복잡한 점-바이올 특징 상호작용을 더 단순한 기둥 기반 특징 피라미드로 대체함으로써 검출 성능과 효율성이 향상되는가?
  • RQ3FPN가 3D 검출 파이프라인의 RPN에 효과적으로 적응되어 작은 객체 검출을 향상시킬 수 있는가?
  • RQ4IoU 인식 기반 신뢰도 보정이 BEV 기반 이단계 3D 검출기에서 제안 품질을 향상시키는가?

주요 결과

  • Pillar R-CNN는 Waymo Open Dataset 검증 세트에서 차량에 대해 76.48% AP, 보행자에 대해 68.54% AP를 달성하여 최신 기술 수준의 이단계 검출기들과 동등하거나 이를 초월한다.
  • 중간 키포인트 추상화 없이도 PV-RCNN와 Voxel R-CNN와 유사한 정확도를 달성한다.
  • RPN에 FPN을 통합함으로써 작은 객체 검출이 향상되었으며, 가장 우수한 성능은 4× 다운샘플링된 특징 맵에서 달성되었다.
  • 풀링 맵에 추가적인 바닥에서 올라오는 특징을 통합할 경우 비용은 증가하지만 성능 향상이 미미하여, 4× 스트라이드 맵만으로도 충분함을 시사한다.
  • IoU 인식 기반 신뢰도 보정은 RPN 성능을 크게 향상시켜, 제안 품질에서 R-CNN 수준의 정확도를 달성할 수 있도록 했다.
  • RPN과 R-CNN의 엔드 투 엔드 훈련이 별도 훈련보다 더 우수한 성능을 내며, 과적합이나 최적 수렴이 보장되지 않는 위험을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.