[논문 리뷰] Embracing Single Stride 3D Object Detector with Sparse Transformer
이 논문은 단일 스트라이드 아키텍처에서 제한된 수신 필드 문제를 해결하기 위해 희소 지역 자기주의를 사용하여 전체 해상도 특징 맵을 네트워크 전반에 걸쳐 유지하는 3D 객체 검출기인 Single-stride Sparse Transformer(SST)을 제안한다. 희소 박막화와 국소 주의를 활용함으로써, Waymo Open Dataset에서 최신 기술 수준의 성능을 달성하였으며, 특히 검증 세트에서 보행자 검출에서 83.8%의 LEVEL_1 AP를 기록하여 뛰어난 성능을 보였다.
In LiDAR-based 3D object detection for autonomous driving, the ratio of the object size to input scene size is significantly smaller compared to 2D detection cases. Overlooking this difference, many 3D detectors directly follow the common practice of 2D detectors, which downsample the feature maps even after quantizing the point clouds. In this paper, we start by rethinking how such multi-stride stereotype affects the LiDAR-based 3D object detectors. Our experiments point out that the downsampling operations bring few advantages, and lead to inevitable information loss. To remedy this issue, we propose Single-stride Sparse Transformer (SST) to maintain the original resolution from the beginning to the end of the network. Armed with transformers, our method addresses the problem of insufficient receptive field in single-stride architectures. It also cooperates well with the sparsity of point clouds and naturally avoids expensive computation. Eventually, our SST achieves state-of-the-art results on the large scale Waymo Open Dataset. It is worth mentioning that our method can achieve exciting performance (83.8 LEVEL 1 AP on validation split) on small object (pedestrian) detection due to the characteristic of single stride. Codes will be released at https://github.com/TuSimple/SST
연구 동기 및 목표
- 보행자와 같은 소규모 3D 객체에 대해 다중 스트라이드 다운샘플링을 사용하는 기존의 접근 방식이 비효율적임을 도전한다.
- 모든 공간 해상도를 유지하는 단일 스트라이드 네트워크가 높은 계산 비용에도 불구하고 다중 스트라이드 기반 모델을 능가할 수 있는지 조사한다.
- 희소한 국소 주의 메커니즘을 사용하여 단일 스트라이드 3D 검출기에서 제한된 수신 필드와 높은 계산 비용이라는 双중 과제를 해결한다.
- 점군의 희소성을 활용하면서도 소형 객체에 대한 강력한 문맥 모델링을 유지하는 모델을 설계한다.
- 희소 3D 박막 격자에 적응된 트랜스포머가 단일 스트라이드 환경에서 기존의 컨볼루션 네트워크를 능가할 수 있음을 입증한다.
제안 방법
- 모든 다운샘플링 연산을 회피하는 단일 스트라이드 백본을 사용하여 3D 점군의 원래 공간 해상도를 유지한다.
- 희소 3D 박막 격자를 국소 영역으로 분할하고 각 영역 내에서 자기주의를 적용함으로써 효과적인 수신 필드를 확장하는 희소 지역 주의(SRA)를 도입한다.
- 모든 주의 계산을 전역적으로 수행하지 않고 비어 있지 않은 박막과 국소 공간 이웃에 국한함으로써 계산 효율성을 확보한다.
- 다중 SRA 블록을 스택하여 깊이 있는 트랜스포머 인코더를 구축함으로써 계층적 특징 학습을 가능하게 하면서도 희소성을 유지한다.
- 모델은 기존의 앵커 기반 또는 앵커리스 헤드에 따라 변형된 표준 3D 검출 헤드를 사용하여 엔드 투 엔드로 훈련된다.
- 이 방법은 기존의 3D 검출 프레임워크와 호환되며 MMDetection3D에 원활하게 통합될 수 있다.
실험 결과
연구 질문
- RQ1보행자와 같은 매우 작은 상대적 크기의 3D 객체를 고려할 때, 3D 객체 검출기에서 다중 스트라이드 다운샘플링이 실질적인 이점을 제공하는가?
- RQ2계산 비용 증가와 수신 필드 감소의 위험에도 불구하고, 단일 스트라이드 3D 검출기가 경쟁 가능한 성능을 달성할 수 있는가?
- RQ3희소한 국소 주의 메커니즘이 높은 계산 비용 없이도 단일 스트라이드 3D 검출기에서 수신 필드를 효과적으로 확장할 수 있는가?
- RQ4희소 3D 공간에서의 주의 메커니즘은 특징 표현력과 효율성 측면에서 확장된 컨볼루션 또는 큰 커널과 비교하여 어떻게 다른가?
- RQ5단일 스트라이드 설계가 보행자와 같은 작은, 감지하기 어려운 객체의 검출 성능 향상에 얼마나 기여하는가?
주요 결과
- 제안된 SST는 Waymo Open Dataset 검증 세트에서 83.8%의 LEVEL_1 AP를 기록하여 3D 객체 검출 분야에서 새로운 최신 기술 수준을 수립했다.
- SST는 보행자 클래스에서 71.1%의 AP를 기록하여 이전 방법들보다 뚜렷이 뛰어난 성능을 보였으며, 이는 소형 객체에 대해 단일 스트라이드 해상도의 이점임을 입증한다.
- 절단 분석 결과, SRA의 영역 크기를 증가시킬수록 보행자 검출 성능이 향상되었으며, 가장 큰 영역 크기에서 최고의 성능를 기록했다.
- SST는 네트워크 깊이에 대해 뛰어난 내성적 편향을 제공하는 주의 메커니즘 덕분에 강건하며, 레이어 수가 적을수록 보행자 검출 성능이 약간 향상되는 경향을 보였다.
- SST는 모든 기준 모델보다 AP 성능에서 뛰어나면서도 낮은 지연 시간을 유지했으며, 특히 큰 커널 희소 컨볼루션 또는 깊은 잔차 네트워크를 사용하는 모델들과 비교해도 뛰어난 성능를 보였다.
- 정성적 분석 결과, 주의 가중치가 강력한 의미적 분류 능력을 보이며 객체의 관련 부분에 집중하고 배경 포인트를 억제함으로써 잡음 감지(false positive)를 줄였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.