Skip to main content
QUICK REVIEW

[논문 리뷰] Focal Sparse Convolutional Networks for 3D Object Detection

Yukang Chen, Yanwei Li|arXiv (Cornell University)|2022. 04. 26.
Advanced Neural Network Applications인용 수 15
한 줄 요약

이 논문은 3D 스퍼스 컨볼루션 네트워크에서 공간적 희소성을 동적으로 학습하기 위해 중요도 맵을 예측하여 특징 확장에 안내하는 Focal Sparse Convolution (Focals Conv) 및 그 다중모odal 변형인 Focals Conv-F를 제안한다. 이 방법은 최소한의 계산 오버헤드로 3D 객체 검출의 특징 표현을 향상시키며, 앙상블이나 테스트 시 증강 없이 nuScenes에서 최신 기술 수준(SoTA) 성능을 달성한다. 이는 테스트 분할에서 71.8% NDS와 67.8% mAP를 기록한다.

ABSTRACT

Non-uniformed 3D sparse data, e.g., point clouds or voxels in different spatial positions, make contribution to the task of 3D object detection in different ways. Existing basic components in sparse convolutional networks (Sparse CNNs) process all sparse data, regardless of regular or submanifold sparse convolution. In this paper, we introduce two new modules to enhance the capability of Sparse CNNs, both are based on making feature sparsity learnable with position-wise importance prediction. They are focal sparse convolution (Focals Conv) and its multi-modal variant of focal sparse convolution with fusion, or Focals Conv-F for short. The new modules can readily substitute their plain counterparts in existing Sparse CNNs and be jointly trained in an end-to-end fashion. For the first time, we show that spatially learnable sparsity in sparse convolution is essential for sophisticated 3D object detection. Extensive experiments on the KITTI, nuScenes and Waymo benchmarks validate the effectiveness of our approach. Without bells and whistles, our results outperform all existing single-model entries on the nuScenes test benchmark at the paper submission time. Code and models are at https://github.com/dvlab-research/FocalsConv.

연구 동기 및 목표

  • 기존 스퍼스 컨볼루션 네트워크에서 공간 중요도에 관계없이 모든 특징을 동일하게 처리하는 한계를 해결하기 위해.
  • 일반 스퍼스 컨볼루션의 비효율성과 특징 흐림 현상, 서브매니폴드 스퍼스 컨볼루션의 정보 흐름 제약을 극복하기 위해.
  • 동적이고 위치 기반의 중요도 예측을 도입하여 특징 확장을 통해 종단간 전이 가능한 학습 가능한 희소성을 실현함으로써 유의미한 전경 특징에 집중할 수 있도록 하기 위해.
  • Focals Conv-F에서 경량의 어텐션 기반 융합 메커니즘을 통해 RGB 이미지 특징과 스퍼스 LiDAR 특징을 융합하여 다중모달 3D 검출을 향상시키기 위해.
  • 특히 복잡하고 대규모 벤치마크인 nuScenes와 같은 환경에서 높은 성능을 내기 위해 공간적으로 학습 가능한 희소성이 필수적임을 입증하기 위해.

제안 방법

  • 예측된 입방체 중요도 맵을 사용해 공간적으로 적응적인 출력 패턴을 학습함으로써 표준 스퍼스 컨볼루션을 대체하는 Focal Sparse Convolution (Focals Conv)을 제안한다.
  • 각 공간 위치에 대해 이진 또는 연속적 중요도 맵을 생성하는 학습 가능한 중요도 예측 헤드를 도입하며, 이는 입력 특징의 확장 조건을 고중요도 바voxels에만 적용한다.
  • 중요도 맵에 기반해 출력 특징 맵의 형태를 동적으로 조정함으로써 유의미한 특징만 확장되도록 하여 희소성을 유지하고 계산량을 줄인다.
  • Focals Conv를 Focals Conv-F로 확장하여, 포인트 클라우드 특징과 RGB 이미지 특징을 포인트 클라우드 특징의 출력 단계에서 융합하고, 경량 특징 융합 모듈을 사용해 외관 및 맥락 정보를 풍부화시킨다.
  • 중요도 예측과 특징 학습을 함께 최적화하여 종단간 전이 가능한 학습을 가능하게 하며, 특징 추출 과정에서 주목할 만한 영역에 집중할 수 있도록 모델을 학습시킨다.
  • 중요도 예측 및 융합에 소량의 추가 파라미터와 FLOPs를 사용하여 모델 복잡도 오버헤드를 최소화한다.

실험 결과

연구 질문

  • RQ1스퍼스 컨볼루션에서 공간적으로 적응 가능한 학습 가능한 희소성은 모든 스퍼스 특징을 동일하게 처리하는 것과 비교해 3D 객체 검출 성능을 향상시키는가?
  • RQ2고중요도 특징만 동적으로 확장함으로써 계산 비용을 줄이고 특징의 구분 능력을 향상시킬 수 있는가?
  • RQ3Focals Conv-F에서 경량 융합 메커니즘을 통해 RGB 특징을 융합함으로써 다중모달 벤치마크에서 검출 정확도를 추가로 향상시킬 수 있는가?
  • RQ4융합 단계와 융합 범위의 선택이 Focals Conv-F를 사용한 다중모달 3D 검출기 성능에 어떻게 영향을 미치는가?
  • RQ5제안된 방법은 다양한 중요도 임계값에 대해 강건한가? 다양한 데이터셋과 설정에서도 성능 안정성을 유지하는가?

주요 결과

  • Focals Conv는 기준 모델인 Voxel R-CNN을 개선하여 KITTI 검증 분할에서 85.22% AP 3D를 달성하였으며, Pyramid-PV 및 VoTr-TSD와 같은 이전 SoTA 방법들을 초월한다.
  • KITTI 테스트 분할에서 Focals Conv-F는 다중모달 설정에서 82.28% AP 3D를 기록하여 기존 단일 모델 기반 기여자들을 능가한다.
  • nuScenes 테스트 벤치마크에서 Focals Conv-F는 앙상블이나 테스트 시 증강 없이도 67.8% mAP와 71.8% NDS를 달성하였으며, 단일 모델 성능 기준으로 새로운 SoTA를 수립한다.
  • 테스트 시 증강을 적용한 경우, Focals Conv-F는 70.1% mAP와 73.6% NDS를 기록하였으며, PointPainting 기반 CenterPoint v2 및 Cascade R-CNN과 같은 앙상블 기반 방법들조차도 능가한다.
  • 절단 분석 결과, 중요도 임계값(τ = 0.1에서 0.9)에 관계없이 성능가 안정적이며, 하이퍼파rameter 선택에 대한 강건성을 입증한다.
  • 특히 중요한 특징에만 초점이 맞춰진 조기 단계 융합이 전체 특징 융합보다 성능이 뛰어나며, 중요한 바voxels에 대한 조기 단계 융합이 최적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.