Skip to main content
QUICK REVIEW

[논문 리뷰] SS3D: Single Shot 3D Object Detector

Aniket Limaye, Manu Mathew|arXiv (Cornell University)|2020. 04. 30.
Advanced Neural Network Applications참고 문헌 18인용 수 4
한 줄 요약

SS3D는 PointPillars의 학습된 입력 표현을 계산 효율적이고 통계적으로 유도된 입력 표현으로 대체하는 단일단계 3D 객체 검출 프레임워크를 제안한다. 이는 LiDAR 및 스테레오 입력에서 최신 기준 성능을 달성한다. 중간 범주에서 자동차의 AP3D는 LiDAR 기반으로 76.84로 향상되었고, 스테레오 기반으로는 45.13로 상승하여 PointPillars 및 기타 최고 성능의 검출기들을 능가하면서도 임베디드 시스템에 적합한 실시간 성능 유지를 달성한다.

ABSTRACT

Single stage deep learning algorithm for 2D object detection was made popular by Single Shot MultiBox Detector (SSD) and it was heavily adopted in several embedded applications. PointPillars is a state of the art 3D object detection algorithm that uses a Single Shot Detector adapted for 3D object detection. The main downside of PointPillars is that it has a two stage approach with learned input representation based on fully connected layers followed by the Single Shot Detector for 3D detection. In this paper we present Single Shot 3D Object Detection (SS3D) - a single stage 3D object detection algorithm which combines straight forward, statistically computed input representation and a Single Shot Detector (based on PointPillars). Computing the input representation is straight forward, does not involve learning and does not have much computational cost. We also extend our method to stereo input and show that, aided by additional semantic segmentation input; our method produces similar accuracy as state of the art stereo based detectors. Achieving the accuracy of two stage detectors using a single stage approach is important as single stage approaches are simpler to implement in embedded, real-time applications. With LiDAR as well as stereo input, our method outperforms PointPillars. When using LiDAR input, our input representation is able to improve the AP3D of Cars objects in the moderate category from 74.99 to 76.84. When using stereo input, our input representation is able to improve the AP3D of Cars objects in the moderate category from 38.13 to 45.13. Our results are also better than other popular 3D object detectors such as AVOD and F-PointNet.

연구 동기 및 목표

  • 실시간 임베디드 시스템에 구현 가능한 고정확도를 유지하는 단일단계 3D 객체 검출 프레임워크를 개발하는 것.
  • PointPillars의 학습된 이중단계 입력 표현을 더 빠르고 비학습 기반의 통계적 계산된 입력 표현으로 대체하는 것.
  • 방법을 스테레오 입력으로 확장하고 의미 분할을 통합하여 단일 이미지 환경에서의 성능 향상을 도모하는 것.
  • 단순한 단일단계 아키텍처를 사용하여 이중단계 검출기 수준의 성능을 달성하는 것.
  • 비학습 기반의 입력 표현이 3D 검출 벤치마크에서 학습 기반 표현을 능가할 수 있음을 입증하는 것.

제안 방법

  • 입력 표현은 복셀 단위로 점군 통계치(예: 평균, 분산, 밀도)를 직접 계산하여 딥러닝 기반 특징 추출을 회피한다.
  • 통계적 입력 표현은 SSD 및 PointPillars를 영감으로 삼은 단일 쇼트 검출 헤드에 입력되어 엔드 투 엔드 추론이 가능하다.
  • 스테레오 입력의 경우, 왼쪽 및 오른쪽 RGB 이미지와 깊이 추정치를 융합하고 의미 분할 맵을 추가 입력 채널로 통합한다.
  • 검출기는 SSD와 유사한 앵커 기반 회귀 및 분류 헤드를 사용하며, BEV(Bird's Eye View) 공간에서 3D 검출에 적합하게 조정된다.
  • 전체 파ip라인은 단일 단계에서 훈련되어 별도의 특징 학습 단계가 필요 없도록 한다.
  • 방법은 PointPillars의 백본 아키텍처를 활용하지만, 학습된 입력 인코더를 기계적으로 학습되지 않은, 미분 가능한 통계적 표현으로 대체한다.

실험 결과

연구 질문

  • RQ1비학습 기반의 통계적 입력 표현이 3D 객체 검출에서 학습 기반의 이중단계 입력 표현을 능가할 수 있는가?
  • RQ2통계적 입력 표현을 사용하는 단일단계 3D 검출기가 최신 기준 이중단계 검출기들과 경쟁 가능한 정확도를 달성할 수 있는가?
  • RQ3제안된 방법이 의미 분할을 통합한 스테레오 입력으로 일반화되어 스테레오 전용 최신 기준 검출기 수준의 성능을 달성할 수 있는가?
  • RQ4통계적 입력 표현이 정확도를 희생시키지 않고 계산 비용을 감소시키고 추론 속도를 향상시킬 수 있는가?
  • RQ5통일된 단일단계 아키텍처를 사용하여 LiDAR 및 스테레오 입력에서 모두 고성능을 달성할 수 있는가?

주요 결과

  • 제안된 통계적 입력 표현은 KITTI 데이터셋에서 LiDAR 입력 기반으로 중간 범주 자동차의 AP3D를 74.99에서 76.84로 향상시켰다.
  • 스테레오 입력 기반으로는 중간 범주 자동차의 AP3D가 기존 PointPillars 설정의 38.13에서 45.13으로 상승했다.
  • AVOD 및 F-PointNet과 같은 다른 최고 수준의 3D 검출기들보다 LiDAR 및 스테레오 벤치마크 양쪽에서 모두 성능이 뛰어나다.
  • 모델 복잡도나 추론 지연을 증가시키지 않으면서 성능 향상을 달성하여 실시간 사용에 적합함을 유지한다.
  • 스테레오 입력에 의미 분할을 통합함으로써 검출 정확도가 크게 향상되었고, 최신 기준 스테레오 검출기 수준에 근접했다.
  • 제거 분석 결과, 이 단일단계 환경에서 통계적 입력 표현이 학습된 표현보다 더 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.