Skip to main content
QUICK REVIEW

[논문 리뷰] RSN: Range Sparse Net for Efficient, Accurate LiDAR 3D Object Detection

Pei Sun, Weiyue Wang|arXiv (Cornell University)|2021. 06. 25.
Advanced Neural Network Applications참고 문헌 38인용 수 7
한 줄 요약

RSN은 효율적인 전경 포인트 분할을 위한 범위 이미지와 선택된 포인트에서의 희소 컨볼루션을 활용하는 새로운 3D LiDAR 객체 검출 프레임워크를 제안한다. 이로 인해 Waymo Open Dataset에서 150m×150m 영역에서 60 FPS 이상으로 주행하면서 기존 방법보다 APH/LEVEL_1 지표와 추론 효율성 측면에서 모두 최고 성능을 달성한다.

ABSTRACT

The detection of 3D objects from LiDAR data is a critical component in most autonomous driving systems. Safe, high speed driving needs larger detection ranges, which are enabled by new LiDARs. These larger detection ranges require more efficient and accurate detection models. Towards this goal, we propose Range Sparse Net (RSN), a simple, efficient, and accurate 3D object detector in order to tackle real time 3D object detection in this extended detection regime. RSN predicts foreground points from range images and applies sparse convolutions on the selected foreground points to detect objects. The lightweight 2D convolutions on dense range images results in significantly fewer selected foreground points, thus enabling the later sparse convolutions in RSN to efficiently operate. Combining features from the range image further enhance detection accuracy. RSN runs at more than 60 frames per second on a 150m x 150m detection region on Waymo Open Dataset (WOD) while being more accurate than previously published detectors. As of 11/2020, RSN is ranked first in the WOD leaderboard based on the APH/LEVEL 1 metrics for LiDAR-based pedestrian and vehicle detection, while being several times faster than alternatives.

연구 동기 및 목표

  • 고속 자율주행을 위한 대규모·장거리 LiDAR 센싱에서 효율적이고 정확한 3D 객체 검출의 과제를 해결한다.
  • 밀도 있는 격자 기반 방법의 비효율성과 순수한 범위 이미지 방법의 음영 처리 및 국소화 한계를 극복한다.
  • 가벼운 엔드 투 엔드 학습 가능한 아키텍처를 통해 확장된 탐지 범위(최대 250m–300m)에서 실시간 추론을 가능하게 한다.
  • 범위 이미지 특징을 통해 고신뢰도 전경 포인트를 식별함으로써 희소 컨볼루션을 고려된 전경 포인트에만 집중시켜 계산 비용을 감소시킨다.
  • Non-maximum suppression를 제거하기 위해 CenterNet 기반 헤드를 활용해 희소 특징에서 직접 3D 박스를 회귀한다.

제안 방법

  • 밀도 있는 범위 이미지에 가벼운 2D 컨볼루션 백본을 적용하여 고해상도 의미 특징을 추출한다.
  • 직접 3D 박스 회귀보다는 높은 재현율을 갖춘 전경 포인트 분할을 학습시켜 효율성과 특징 품질을 향상시킨다.
  • 예측된 전경 포인트와 그 관련 특징에만 희소 컨볼루션을 적용하여 전체 격자 처리 대비 계산을 극적으로 감소시킨다.
  • 희소 박스 특징에 특화된 커스터마이즈된 CenterNet 헤드를 통합하여 NMS 없이 엔드 투 엔드로 3D 경계 상자 예측을 수행한다.
  • 최소한의 추론 오버헤드로 연속 프레임의 자이로모션 보정된 (x,y,z) 특징을 융합하는 시간적 융합 전략을 적용한다.
  • 학습 및 추론 시 전경 포인트 재현율과 모델 지연 시간을 균형 잡기 위해 가속 가능한 임계값(γ)과 손실 가중치(λ₁)를 도입한다.
Figure 2: (Best viewed in color) Range Sparse Net object detection architecture. The net consists of five components: 1) Range image feature extraction: a 2D convolution net on range images to extract associated image features. 2) Foreground point selection: foreground points are segmented on range
Figure 2: (Best viewed in color) Range Sparse Net object detection architecture. The net consists of five components: 1) Range image feature extraction: a 2D convolution net on range images to extract associated image features. 2) Foreground point selection: foreground points are segmented on range

실험 결과

연구 질문

  • RQ1범위 이미지 처리와 전경 포인트에 대한 희소 컨볼루션을 조합한 이중 단계 검출 파이프라인은 장거리 3D LiDAR 검출에서 높은 정확도와 실시간 추론을 동시에 달성할 수 있는가?
  • RQ2범위 이미지 특징을 통한 전경 포인트 선택은 전체 격자 또는 밀도 있는 특징 처리 대비 검출 정확도와 계산 효율성에 어떤 영향을 미치는가?
  • RQ3범위 이미지 기반 특징은 특히 음영이나 낮은 포인트 밀도 상황에서 소형 또는 장거리 객체의 검출 성능을 얼마나 향상시킬 수 있는가?
  • RQ4희소 헤드에서의 기울기 흐름이 범위 이미지 인코더로 되돌아오는 엔드 투 엔드 학습은 고립된 단계 대비 검출 품질을 향상시키는가?
  • RQ5표준 벤치마크를 초월해 더 큰 탐지 범위(예: 250m×250m)에 대해 모델이 효과적으로 확장될 수 있는가, 성능 저하 없이?

주요 결과

  • RSN은 Waymo Open Dataset에서 차량에 대해 LEVEL_2에서 64.2/63.9 AP/APH, 보행자에 대해 68.88/66.07을 기록하여 이전의 모든 LiDAR 전용 방법을 능가한다.
  • 150m×150m 탐지 영역에서 60 FPS 이상으로 실행되며, PV-RCNN 및 PointPillars와 같은 대안보다 훨씬 빠르면서도 더 높은 정확도를 유지한다.
  • 전경 포인트 선택 임계값 γ < 0.5일 경우 지연 시간이 50% 이상 감소하고 AP는 1–2% 감소하여 효율성-정확도 트레이드오��� 제어가 매우 우수함을 입증한다.
  • 제거 실험 결과 범위 이미지 특징(RIFE)이 차량에 대해 3.3%, 보행자에 대해 4.3%의 정확도 향상을 이끌어내었으며, 특히 장거리 탐지에서 유의미한 이점이 있다.
  • 내부 장거리 데이터셋(250m×250m)에서 RSN은 83.6 BEV APH와 61.2 3D APH를 기록하며 22ms의 지연 시간을 달성했고, 비희소 기준 모델(79.4 BEV APH, 53.4 3D APH, 44ms 지연)을 능가했다.
  • 히트맵 정규화(표 4의 row -Norm 제거)를 제거할 경우 보행자 APH가 0.8점 감소하여 정확한 키포인트 국소화에 중요함을 확인했다.
Figure 3: Range image U-Net feature extractor to compute high level semantic range features. See section 3.1 for details.
Figure 3: Range image U-Net feature extractor to compute high level semantic range features. See section 3.1 for details.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.